马力AI和商业思维
26-07-01 16:30 微博认证:知群 CEO 微博新知博主

公司里那堆 PDF、Word、PPT、扫描件,最麻烦的不是「有没有」,而是你根本不知道答案躺在哪个文件夹里。

腾讯开源的 WeKnora,解决的是这个很具体的问题:把一堆文档整理成一个能问答的知识库。你问一句,它去资料里找答案,还能把出处带回来,让你知道这句话来自哪份文件、哪一段。

这类工具的难点,其实不在「接个大模型」。真正麻烦的是前面的文档处理流水线:解析各种格式、把内容切块、做关键词检索和向量检索、再把相关片段交给模型回答。任何一环做得粗糙,最后都会变成一本正经地胡说。

WeKnora 比较扎实的点,是它把这条链路打包好了。PDF、Word、Markdown、网页、图片、表格、PPT 等格式都能进;检索也不是只靠向量,还包括 BM25、GraphRAG、父子分块这些办法。

它适合的是「手里真有一堆资料,想变成可查询知识库」的人。合同、内部流程、研报、说明书,都属于这一类。前提是你得先把模型、部署和数据流向想清楚:接本地模型才更接近数据不出门,接云端模型就不能只看「本地部署」四个字。

#马力的AI知识分享#
#马力的AI开源项目分享#

发布于 北京