返回文章列表

从Demo到生产:AI产品评测体系搭建指南

2026年8月22日9 分钟读完

从Demo到生产:AI产品评测体系搭建指南

Demo 效果好 = 产品可用?这两者之间隔着一套评测体系。

"演示的那一刻越惊艳,上线后的落差就越刺眼。"这是我带团队血泪换来的认知。这篇系统讲讲怎么搭一套让 AI 产品敢于上线的评测体系。

为什么传统测试方法失效了

传统软件的测试是确定性的:输入 X 必须输出 Y,断言写起来轻松。大模型产品的输出是概率性的、自然语言的、开放域的。你的断言怎么写?"回答不能错"不是断言,是愿望。

所以 AI 评测的本质是:用统计学方法,对非确定性系统做质量度量。

评测体系的三层结构

第一层:自动指标(每次提交必跑)

  • 精确匹配类:分类任务的准确率、JSON 输出的格式合法率
  • 规则校验类:敏感词、字数限制、必含要素(如必须引用来源)
  • 成本与性能:Token 用量、延迟 P95

这层必须全自动化、进 CI、有阈值卡点。

第二层:模型辅助评测(每日跑)

用强模型当裁判(LLM-as-a-Judge)评估开放性输出。这里有个关键坑:裁判模型和被评模型不能同源,否则有系统性偏袒。我们用"多裁判投票 + 争议样本人工复核"来控制裁判的信度。

评测维度按业务定制,比如客服场景:事实正确性、完整性、语气合规、有无过度承诺。

第三层:人工评测(每周跑)

抽样真实流量,业务专家盲评。这层的价值除了校准前两层,更重要的是发现新问题类型——很多 badcase 模式是人工评测第一次发现的,发现后再沉淀成第一层的自动规则。

评测体系是滚动的:人工发现模式 → 自动化 → 模型评测覆盖长尾 → 人工探索新的边界。

评测集怎么建

三条来源,缺一不可:

  1. 专家构造:冷启动用,覆盖核心场景,但分布过于"理想"
  2. 真实流量采样:上线后主力来源,保持与线上分布一致
  3. 对抗样本:专门收集攻击性、诱导性、边界输入,这是安全评测的基础

我们目前的评测集有 12,000 条,按"场景 × 难度 × 风险等级"三个维度打了标,任何一次模型或 Prompt 变更,30 分钟出全量回归报告。

上线后的持续校准

一个残酷的事实:线上用户行为会漂移,评测集半年不更新,和线上真实表现的差距会大到失去参考价值。我们的做法:

  • 每月从线上采样补充评测集,淘汰过时案例
  • 用线上真实标注数据做"金标准集",校准自动评测的信度
  • 关键指标做日报,异常波动(比如幻觉率突然 +1%)触发告警

写给正在起步的团队

如果只能做三件事,我会选:

  1. 上线前:建一个 500 条的最小评测集(哪怕手写),定好基线
  2. 上线时:全链路日志打点,让每个 badcase 可回放
  3. 上线后:每周一次人工抽评,雷打不动

评测体系不能保证你的产品不出问题,但它保证出问题的时候,你在 30 分钟内知道,而不是一个月后从客诉里知道。