AI产品的成本账:Token经济学与定价设计
2026年8月23日约 8 分钟读完
AI产品的成本账:Token经济学与定价设计
CEO 问我:"我们每天烧在模型调用上的钱,到底花在哪了?"
这个问题当时答不好,团队里没人能拆清楚。于是我们花了两周建了一套 Token 成本核算体系,后来又用同样的思路设计了产品定价。这篇讲讲方法论。
第一步:把成本拆到"原子单位"
传统软件的成本大头是服务器和人力,AI 产品的独特之处在于边际成本不为零——每多一次调用就多一份真金白银的支出。
我们把成本拆成五层:
单次调用成本 = 输入Token × 输入单价 + 输出Token × 输出单价
+ 向量检索成本 + 功能附加成本(搜索/图片生成等)
+ 请求链路上其他服务的成本
关键动作是按场景归集:客服问答、文档摘要、数据分析……每个场景的 token 用量、模型档位都不同,混在一起看总数永远是一笔糊涂账。
第二步:找到成本的大头
拆完发现一个反直觉的事实:占调用量 92% 的是 B 级轻量场景,但只占成本的 34%;占调用量 8% 的复杂推理场景,吃掉了 46% 的成本。
优化顺序因此非常清晰:
- 轻量场景下探模型档位:意图分类换小模型,成本降 94%(前文提过)
- 压缩上下文:长对话历史做摘要压缩,RAG 召回做粗排精排两级,输入 token 平均减少 40%
- 缓存:相同问题命中缓存直接返回,命中率 18%,白捡的成本节约
- 限流与熔断:防止单一用户/异常流量刷爆账单
四板斧下去,总成本降了 61%,服务质量指标无回退。
第三步:定价不是成本的简单加成
AI 产品的定价设计有三个流派:
| 流派 | 做法 | 适合 |
|---|---|---|
| 按量计费 | 按调用次数/Token 收费 | API 类、开发者产品 |
| 订阅制 | 月费+用量上限 | ToC 效率工具 |
| 价值定价 | 按替代的人力成本定价 | 替代重复劳动的 B 端产品 |
我们最终选了订阅 + 分级用量的混合模式:基础订阅费覆盖成本底线,用量阶梯在超阈值后计价——既避免重度用户把毛利吃穿,也让轻度用户感知便宜。
一个容易忽略的账:退款与滥用
上线三个月我们发现了"提示词注入盗取算力"的滥用模式——用户构造超长输入反复触发重推理。应对方案:输入长度硬限制 + 单用户单位时间 Token 配额 + 异常模式告警。成本安全是 AI 应用的新命题,传统风控团队没有这块经验,负责落地的工程师要主动补位。
结余:一本可以复算的账
现在每个月的成本报告长这样:分场景调用量、Token 用量、模型成本、缓存节约、单位经济模型(每次会话净成本)。财务看得懂,业务可归因,CEO 的那个问题,我现在 30 秒能答完。
做 AI 应用不会算账,就像厨师不尝菜。