"把我们的文档传进去,就能问答了吧?"
理论上是的,实际上不是。文档整理的工作量通常占整个项目的一半,而且这一步的质量直接决定最终效果。
按我们做项目的顺序,把七步讲清楚,每一步都说一下会踩的坑。
第一步:明确问答的场景边界
先回答一个问题:谁、在什么情况下、问什么。
三种典型场景,做法完全不同:
- 对外客服:客户问产品、价格、售后。要求回答口径统一、不能乱承诺
- 对内查询:员工问制度、流程、报销标准。要求准确、能追到出处
- 销售支持:销售问产品参数、竞品差异、报价规则。要求快速、可组合
坑:一上来就做"什么都能问"的通用助手。范围越宽,效果越差,因为知识库要覆盖的面太大,检索准确率直线下降。建议先锁定一个场景,做出效果再扩。
第二步:文档盘点与清洗
这一步最土,也最重要。要做的事:
- 1. 把现有资料全部找出来:产品手册、制度文件、FAQ、历史工单、培训材料、微信群里的高频问答
- 2. 剔除过期和矛盾的版本(这一条特别关键,AI 会把你喂给它的所有东西都当真的)
- 3. 统一术语(同一个东西在三个文档里有三个叫法,AI 会当成三件事)
- 4. 把扫描件、图片里的内容转成文字
坑:客户把过去五年的全部资料一股脑给过来,里面有 2019 年的价格表和 2025 年的价格表。AI 检索到哪份就答哪份,客户投诉说"你们报价前后不一致"。
我们的做法:整理阶段会和客户一起过一遍,明确"以哪个版本为准",把作废版本单独归档、不进入知识库。
第三步:切片与索引
把长文档拆成合适大小的片段,转成可检索的形式。听起来很技术,但判断标准很朴素:
拆出来的每一段,单独看能不能回答一个问题? 能,就是好切片;不能,就要调整。
坑:切片太大(一整章),检索出来的内容包含太多无关信息,AI 答得又长又偏;切片太小(一句话),丢掉了上下文,AI 答得残缺。
实操经验是:按语义自然段落切,遇到表格和清单要整体保留。表格被切一半是经典事故——客户问价格,AI 答了半张表。
第四步:检索策略与口径设定
这一步决定"AI 找得到、答得对"。
要配置的包括:
- 检索条数:一次给 AI 几条参考资料。太少漏信息,太多干扰判断
- 相似度阈值:低于这个阈值就不硬答,走兜底
- 回答口径:语气是正式还是亲和、能不能给建议、能不能说"不确定"
- 优先来源:同一个问题有多份资料时,以哪个为准
坑:不设兜底阈值。结果 AI 在知识库里找不到答案时,就用模型自己的常识编一个。这在客服场景里是灾难。
第五步:构建测试集(这一步最多人跳过)
我们自己项目里必做的一步:让业务方列出 50 到 100 个真实问题,连同"标准答案",然后拿系统跑一遍,人工核对。
测试集要包括三类:
- 1. 常见问题(占 70%):日常最高频的那些
- 2. 边界问题(占 20%):专业细节、多条件组合
- 3. 不该答的问题(占 10%):超出范围、涉及承诺、恶意提问
第 3 类最容易被忽略,但它是上线后投诉的主要来源。必须明确测试"它该拒答的时候会不会拒答"。
第六步:接入与权限
技术接入不复杂,但权限要设计清楚:
- 不同角色能问到不同内容(销售不该查到财务制度)
- 有权限的文档才进对应人的检索范围
- 所有问答留日志(出问题时能追)
坑:把全公司文档都放进一个知识库,所有人都能搜到。这一条在政企和制造业客户那里是硬红线,一定要在方案阶段就确认。
第七步:上线后的持续维护
上线不是结束。要有人负责:
- 每周看一遍"答不出来的问题",补进知识库(这是知识库成长最快的方式)
- 每月核对一次准确率,看有没有下降
- 业务变化时同步更新(改价格、改政策、上新产品)
这是 AI 知识库能不能活过半年的分水岭。 有人维护的知识库会越来越准,没人维护的三个月就废。
一个大致的时间预期
| 阶段 | 通常耗时 |
|---|---|
| 场景确定 + 文档盘点 | 1~2 周 |
| 数据清洗与切片 | 1~3 周(取决于资料有多乱) |
| 系统配置与调优 | 1 周 |
| 测试集验证与修正 | 1~2 周 |
| 接入与上线 | 3~5 天 |
整体 1 到 2 个月。其中真正写代码的时间不到三分之一,其余都在处理数据。
最后说个实话
这个领域现在被包装得很玄,动不动就是"大模型 + 智能体 + 企业大脑"。但从项目落地看,决定成败的是第二步和第五步——把资料整理对,把验收标准定清楚。这两件事都不需要多高的技术,需要的是耐心。
我们给客户做这类项目,第一步永远是拿一堆真问题去测现有资料,看看能答对多少。这个测试两小时就能做完,做完你自己就知道该不该做、值不值得做。
如果你手上有一堆文档想整理成可问答的知识库,可以把文档类型和大致规模说说——我们先看看有没有必要上 AI,有些情况关键词搜索加个好目录就够了。
本文为引潮网络原创内容,基于真实项目与本地报价经验撰写,转载请注明出处。