从0到1打造AI客服产品:我的踩坑实录
2026年8月27日约 8 分钟读完
从0到1打造AI客服产品:我的踩坑实录
这不是一篇成功学文章,而是一份真实的踩坑记录。
去年年初,我接手了公司第一个 AI 客服产品的从 0 到 1。彼时团队对大模型的认知基本停留在"ChatGPT 很聪明"的层面,三个月后产品上线,六个月后日活突破五万。回头看,有几个坑几乎每个做 AI 客服的团队都会踩。
第一个坑:把大模型当万能答案机
最初的产品方案非常直接:把用户问题丢给大模型,让它回答。Demo 阶段效果惊艳,内测阶段一塌糊涂——模型会一本正经地编造退货政策,把去年的活动价格当现行价格报给用户。
教训:AI 客服的第一性原理是"可控",其次才是"聪明"。 我们最终采用了三层架构:
- 意图路由层:先做意图分类,明确的问题走规则和知识库检索
- 知识增强层:RAG 检索公司真实政策文档,模型只负责组织语言
- 兜底与转人工:置信度低于阈值时,毫不犹豫转人工
第二个坑:评测集建设滞后
上线前一周我们才发现没有像样的评测集。临时拉了 200 条测试问题,准确率 91%,上线后真实场景只有 76%。差距来自哪?测试集是我们写的,用户的问题千奇百怪。
后来我们建立了"评测集即资产"的机制:
- 每周从真实对话中抽样标注 500 条进入评测集
- 评测集按场景分层(售前咨询/售后处理/投诉/闲聊)
- 任何模型或 Prompt 改动,必须先过回归评测
第三个坑:忽略了延迟体验
首字延迟超过 3 秒,用户就会认为"卡了"。我们把流式输出(Streaming)的优先级提到很高,并且做了首 Token 延迟(TTFT)监控。P95 的 TTFT 从最初的 4.2 秒压到 1.1 秒,用户满意度提升了 11 个百分点——比任何一轮 Prompt 优化的效果都明显。
复盘:AI 产品的关键指标体系
| 指标 | 含义 | 我们的目标线 |
|---|---|---|
| 解决率 | 无需人工介入解决的比例 | ≥ 65% |
| 幻觉率 | 抽检中发现编造事实的比例 | ≤ 2% |
| TTFT | 首 Token 延迟 P95 | ≤ 1.5s |
| 转人工率 | 转人工对话占比 | ≤ 30% |
| 用户满意度 | 会话级点赞率 | ≥ 85% |
做 AI 产品这一年,我最大的感受是:大模型给了你一个 80 分的起点,而剩下 20 分的产品化工作,比传统软件产品更琐碎、也更关键。
写于产品上线一周年,纪念那些凌晨三点看 badcase 的夜晚。