返回文章列表

从0到1打造AI客服产品:我的踩坑实录

2026年8月27日8 分钟读完

从0到1打造AI客服产品:我的踩坑实录

这不是一篇成功学文章,而是一份真实的踩坑记录。

去年年初,我接手了公司第一个 AI 客服产品的从 0 到 1。彼时团队对大模型的认知基本停留在"ChatGPT 很聪明"的层面,三个月后产品上线,六个月后日活突破五万。回头看,有几个坑几乎每个做 AI 客服的团队都会踩。

第一个坑:把大模型当万能答案机

最初的产品方案非常直接:把用户问题丢给大模型,让它回答。Demo 阶段效果惊艳,内测阶段一塌糊涂——模型会一本正经地编造退货政策,把去年的活动价格当现行价格报给用户。

教训:AI 客服的第一性原理是"可控",其次才是"聪明"。 我们最终采用了三层架构:

  1. 意图路由层:先做意图分类,明确的问题走规则和知识库检索
  2. 知识增强层:RAG 检索公司真实政策文档,模型只负责组织语言
  3. 兜底与转人工:置信度低于阈值时,毫不犹豫转人工

第二个坑:评测集建设滞后

上线前一周我们才发现没有像样的评测集。临时拉了 200 条测试问题,准确率 91%,上线后真实场景只有 76%。差距来自哪?测试集是我们写的,用户的问题千奇百怪。

后来我们建立了"评测集即资产"的机制:

  • 每周从真实对话中抽样标注 500 条进入评测集
  • 评测集按场景分层(售前咨询/售后处理/投诉/闲聊)
  • 任何模型或 Prompt 改动,必须先过回归评测

第三个坑:忽略了延迟体验

首字延迟超过 3 秒,用户就会认为"卡了"。我们把流式输出(Streaming)的优先级提到很高,并且做了首 Token 延迟(TTFT)监控。P95 的 TTFT 从最初的 4.2 秒压到 1.1 秒,用户满意度提升了 11 个百分点——比任何一轮 Prompt 优化的效果都明显。

复盘:AI 产品的关键指标体系

指标含义我们的目标线
解决率无需人工介入解决的比例≥ 65%
幻觉率抽检中发现编造事实的比例≤ 2%
TTFT首 Token 延迟 P95≤ 1.5s
转人工率转人工对话占比≤ 30%
用户满意度会话级点赞率≥ 85%

做 AI 产品这一年,我最大的感受是:大模型给了你一个 80 分的起点,而剩下 20 分的产品化工作,比传统软件产品更琐碎、也更关键。


写于产品上线一周年,纪念那些凌晨三点看 badcase 的夜晚。