这两年我看过不少 AI 项目,也接过几个"已经做了一半想重做"的。这些项目有个共同特征:演示的时候特别惊艳,上线一个月就没人用了。
这种情况比"技术做不出来"更常见,也更贵——钱花了,时间花了,团队对 AI 的信心也耗掉了。
原因基本是五个。
一、Demo 是精心挑过的问题
几乎所有失败的 AI 项目,都有这一场演示:用准备好的十个问题,系统对答如流。
问题在于,这十个问题通常是最典型、最干净、答案最明确的那十个。而真实用户问的是:错别字、口语化、一句话问三件事、带着情绪、问的是资料里没有的。
怎么破:验收测试集必须由业务方出,不能让开发方自己出。而且要从真实历史记录里随机抽——客服聊天记录、工单、微信群,抽 100 条,其中包含错别字、方言化表达、复合问题。
我们的做法是:测试集在项目开始时就锁定,双方各留一份,最后用它验收。测试集不能中途换,这是基本纪律。
二、真实问题超出知识边界
Demo 用的知识库里什么都有答案。上线后用户开始问资料里没写的东西,这时系统的表现就分两种:
- 说"我不太确定" → 体验打折,但不会出错
- 硬编一个答案 → 编造的价格、编造的政策、编造的承诺
第二种是投诉事故的源头。我见过最严重的一次:AI 客服自己"承诺"了七天无理由退货,而实际政策是三天。客户拿着聊天记录来投诉,商家只能认。
怎么破:兜底策略必须在合同里写死——检索不到就明确说不知道,然后引导转人工。同时测试集里要有 10% 的"不该答的问题",专门测它会不会乱答。
三、没人负责维护
这是最致命的一条,也是最少被写进合同的一条。
AI 系统上线后的前三个月,会出现大量的"答不准"和"该更新":
- 业务改了政策,知识库还是旧的
- 高频问题没被覆盖
- 检索不出来的问法,需要调整
如果没有明确的负责人(能进后台改知识条目的人),这个系统三个月后必然变成一个谁都不爱用的东西。 因为员工发现它答错,就不再信任它;客户发现它答错,就不再使用它。
怎么破:项目方案里必须写清楚"知识库维护责任人",而且在交付时要给这个人做培训。我们一般建议由客服主管或运营负责,每周花两三个小时看一遍"答不出来的问题"清单,补齐。这个动作做与不做,半年后系统效果差三倍以上。
四、成本失控
用云端 API 的方案,费用是按调用量走的。上线前按每天 200 次调用估的预算,上线后如果被搜索引擎收录、或者用户疯狂试用,可能变成一天 2 万次。
还有一种隐性成本:为了追求效果好,把整份文档都塞进提示里(而不是走 RAG 检索),token 消耗是正常方案的十几倍。
怎么破:
- 1. 上线前设每日调用上限和告警
- 2. 做好检索优化,不要靠塞长文本硬撑
- 3. 上线后每周看一次成本曲线,发现异常及时排查
我们交付时会带一个成本监控看板,能看每天调用次数、平均 token 消耗、异常高峰。这一项客户一开始常觉得多余,出过一次账单暴涨后就都懂了。
五、权限和合规没设计
Demo 阶段用的是一份干净的资料,不分角色。上线后接进企业内网,问题来了:
- 销售能查到财务制度吗?
- 分公司能查到总部的合同?
- 问答日志里有没有存客户隐私?
- 数据出境了吗(如果用了境外模型 API)?
怎么破:这些必须在方案阶段就定,不能等上线后补。特别是政企和制造业客户,权限分级几乎是硬性要求。做法是按角色划分知识库范围,检索时带上权限过滤,而不是检索完再筛(后者容易漏)。
一套验收该盯的指标
不谈玄的,就盯这几条:
| 指标 | 怎么测 | 参考线 |
|---|---|---|
| 常见问题准确率 | 100 条真实问题,人工核对 | 85% 以上 |
| 拒答准确率 | 20 条超范围问题,看是否拒答 | 90% 以上(不能硬答) |
| 转人工率 | 统计转人工比例 | 太高说明知识不够,太低要怀疑在硬答 |
| 首字响应时间 | 从提问到出字 | 3 秒内 |
| 单次问答成本 | 账单 / 调用次数 | 上线前估值的 ±30% 内 |
| 知识更新时间 | 业务改政策后,多久同步到系统 | 24 小时内 |
最后一条最容易被忽略,但它决定系统能不能活到第二年。
说句实在话
AI 项目的成败,八成不在模型上。它在于你有没有把业务问题定义清楚、有没有人负责养它、有没有一套真实的验收标准。
这也是为什么我们这个团队做 AI 应用,前面一定要花时间和客户一起做三件事:出真实测试集、明确维护责任人、定兜底策略。这三件事听着不像"技术活",但做完之后项目成功率完全不同。
如果你手上有一个做了一半的 AI 项目,效果不理想,可以把现状说说——先判断问题是出在数据、检索、还是口径上,这三处的解法完全不一样。
本文为引潮网络原创内容,基于真实项目与本地报价经验撰写,转载请注明出处。