把 200 页产品手册变成能问答的知识库:一次真实落地复盘
背景:一堆 PDF,没人愿意翻
我们团队有一份 200 页的产品手册,新人入职全靠老员工口口相传。问题很明显:手册查不到、问人又打扰。于是我试着用 AI 把它变成「能直接问」的知识库。下面是真实过程和踩过的坑。
方案:本地模型 + 向量库,文档不出内网
考虑到手册含未公开规格,我选了本地部署路线:用 Ollama 跑一个 7B 级别的中文模型做问答,配 Chroma 存向量,前端用 AnythingLLM 接对话框。整套跑在一台闲置开发机上,文档从不离开公司网络。
落地步骤(复盘版)
1. 先洗文档,再喂模型。原始 PDF 里夹了大量扫描图,OCR 出来的文字错字连篇。我先用脚本把图片页单独导出、重识别,纯文本页直接抽取。这一步占掉总工时的六成,但值得——脏数据进去,问答必崩。
2. 切块别太大。一开始按「一页一段」切,模型经常答非所问。改成按标题小节切、单段控制在 500 字内后,命中率明显上升。
3. 给模型设边界。提示词写明「只依据手册内容回答,查不到就说不知道」。上线第一周就拦住好几回编造参数的情况。
效果与代价
新人查一个参数从平均 8 分钟降到 20 秒,老员工被临时咨询的次数少了一半。代价是:本地 7B 模型对长句推理一般,复杂故障排查仍得人工;开发机偶尔满载,问答会卡。
三条经验,照抄不亏
- 知识库的质量上限是「原始文档的干净程度」,清洗永远是第一优先级。
- 小模型够用就别追大模型,省下的算力能多服务几个人。
- 一定要加「查不到就拒答」的护栏,否则它比人还能编。
这套东西现在成了新人入职的第一站。下一步我打算把常见问答沉淀成固定卡片,进一步减少对模型的依赖。
文章版权声明:除非注明,否则均为开源技术之家原创文章,转载或复制请以超链接形式并注明出处。



还没有评论,来说两句吧...