从Demo到生产:AI产品评测体系搭建指南
2026年8月22日约 9 分钟读完
从Demo到生产:AI产品评测体系搭建指南
Demo 效果好 = 产品可用?这两者之间隔着一套评测体系。
"演示的那一刻越惊艳,上线后的落差就越刺眼。"这是我带团队血泪换来的认知。这篇系统讲讲怎么搭一套让 AI 产品敢于上线的评测体系。
为什么传统测试方法失效了
传统软件的测试是确定性的:输入 X 必须输出 Y,断言写起来轻松。大模型产品的输出是概率性的、自然语言的、开放域的。你的断言怎么写?"回答不能错"不是断言,是愿望。
所以 AI 评测的本质是:用统计学方法,对非确定性系统做质量度量。
评测体系的三层结构
第一层:自动指标(每次提交必跑)
- 精确匹配类:分类任务的准确率、JSON 输出的格式合法率
- 规则校验类:敏感词、字数限制、必含要素(如必须引用来源)
- 成本与性能:Token 用量、延迟 P95
这层必须全自动化、进 CI、有阈值卡点。
第二层:模型辅助评测(每日跑)
用强模型当裁判(LLM-as-a-Judge)评估开放性输出。这里有个关键坑:裁判模型和被评模型不能同源,否则有系统性偏袒。我们用"多裁判投票 + 争议样本人工复核"来控制裁判的信度。
评测维度按业务定制,比如客服场景:事实正确性、完整性、语气合规、有无过度承诺。
第三层:人工评测(每周跑)
抽样真实流量,业务专家盲评。这层的价值除了校准前两层,更重要的是发现新问题类型——很多 badcase 模式是人工评测第一次发现的,发现后再沉淀成第一层的自动规则。
评测体系是滚动的:人工发现模式 → 自动化 → 模型评测覆盖长尾 → 人工探索新的边界。
评测集怎么建
三条来源,缺一不可:
- 专家构造:冷启动用,覆盖核心场景,但分布过于"理想"
- 真实流量采样:上线后主力来源,保持与线上分布一致
- 对抗样本:专门收集攻击性、诱导性、边界输入,这是安全评测的基础
我们目前的评测集有 12,000 条,按"场景 × 难度 × 风险等级"三个维度打了标,任何一次模型或 Prompt 变更,30 分钟出全量回归报告。
上线后的持续校准
一个残酷的事实:线上用户行为会漂移,评测集半年不更新,和线上真实表现的差距会大到失去参考价值。我们的做法:
- 每月从线上采样补充评测集,淘汰过时案例
- 用线上真实标注数据做"金标准集",校准自动评测的信度
- 关键指标做日报,异常波动(比如幻觉率突然 +1%)触发告警
写给正在起步的团队
如果只能做三件事,我会选:
- 上线前:建一个 500 条的最小评测集(哪怕手写),定好基线
- 上线时:全链路日志打点,让每个 badcase 可回放
- 上线后:每周一次人工抽评,雷打不动
评测体系不能保证你的产品不出问题,但它保证出问题的时候,你在 30 分钟内知道,而不是一个月后从客诉里知道。