返回文章列表

大模型选型实战:没有最好的模型,只有最合适的场景

2026年8月26日7 分钟读完

大模型选型实战:没有最好的模型,只有最合适的场景

每次有新模型发布,老板都会问我:"要不要换?"

这句话我去年听了不下十次。这一篇系统梳理一下我的选型方法论,也回应一个常见误区:选型不是选"最强的模型",而是为每个业务场景匹配"性价比最优的模型"。

建立场景分级

我们先把公司的 47 个 AI 应用场景做了分级:

S 级:高价值 + 高风险

比如合同审查、医疗问答。这类场景只考虑头部闭源模型,准确率优先,成本可以往后放。评测不达标的模型直接一票否决。

A 级:高价值 + 低风险

比如营销文案生成、周报总结。头部模型和优质开源模型都可胜任,我们会做严格的盲测对比——把不同模型的输出去掉标识,让业务方打分。有意思的是,国产中档模型在中文营销文案上经常打赢进口旗舰。

B 级:低价值 + 高频

比如文档摘要、标签提取、意图分类。这是成本敏感区,用小模型 + 微调往往是最优解。我们把意图分类从旗舰模型换成 7B 微调小模型后,成本降了 94%,准确率反而升了 2 个点。

C 级:低价值 + 低频

能自动化就自动化,能用规则就别上模型。

我常用的评测维度

选型评测不能只看榜单,榜单是"考试",生产是"开卷 + 限时 + 干扰项齐全"。我们的评测矩阵:

  1. 任务准确率:业务自有评测集上的准确率(权重最高)
  2. 指令遵循:格式要求、长度要求、拒答要求是否稳定满足
  3. 中文能力:语境理解、成语俗语、敏感边界
  4. 延迟与吞吐:P95 TTFT、并发承载能力
  5. 价格:按我们的实际 token 用量折算单次调用成本
  6. 供应商稳定性:限流政策、SLA、数据合规

别忘了"组合拳"

最终生产环境里,我们很少单用一个模型。典型链路:

小模型做意图分类 → 中档模型 + RAG 做常规问答 → 旗舰模型兜底复杂推理

这条链路比"全程旗舰"便宜一个数量级,整体准确率反而因为路由精准而更高。

选型之外的忠告

  • 写好抽象层:模型可随时替换,不要让业务代码绑定任何一家的 SDK 细节
  • 持续评测:模型供应商会静默更新,你的评测集要周周跑
  • 留好回滚方案:新模型上线前,旧配置随时可切回

模型市场每三个月洗一次牌,但选型方法论不会过时:先定义场景,再定义评测,最后才谈模型。