返回文章列表

AI产品的成本账:Token经济学与定价设计

2026年8月23日8 分钟读完

AI产品的成本账:Token经济学与定价设计

CEO 问我:"我们每天烧在模型调用上的钱,到底花在哪了?"

这个问题当时答不好,团队里没人能拆清楚。于是我们花了两周建了一套 Token 成本核算体系,后来又用同样的思路设计了产品定价。这篇讲讲方法论。

第一步:把成本拆到"原子单位"

传统软件的成本大头是服务器和人力,AI 产品的独特之处在于边际成本不为零——每多一次调用就多一份真金白银的支出。

我们把成本拆成五层:

单次调用成本 = 输入Token × 输入单价 + 输出Token × 输出单价
             + 向量检索成本 + 功能附加成本(搜索/图片生成等)
             + 请求链路上其他服务的成本

关键动作是按场景归集:客服问答、文档摘要、数据分析……每个场景的 token 用量、模型档位都不同,混在一起看总数永远是一笔糊涂账。

第二步:找到成本的大头

拆完发现一个反直觉的事实:占调用量 92% 的是 B 级轻量场景,但只占成本的 34%;占调用量 8% 的复杂推理场景,吃掉了 46% 的成本。

优化顺序因此非常清晰:

  1. 轻量场景下探模型档位:意图分类换小模型,成本降 94%(前文提过)
  2. 压缩上下文:长对话历史做摘要压缩,RAG 召回做粗排精排两级,输入 token 平均减少 40%
  3. 缓存:相同问题命中缓存直接返回,命中率 18%,白捡的成本节约
  4. 限流与熔断:防止单一用户/异常流量刷爆账单

四板斧下去,总成本降了 61%,服务质量指标无回退。

第三步:定价不是成本的简单加成

AI 产品的定价设计有三个流派:

流派做法适合
按量计费按调用次数/Token 收费API 类、开发者产品
订阅制月费+用量上限ToC 效率工具
价值定价按替代的人力成本定价替代重复劳动的 B 端产品

我们最终选了订阅 + 分级用量的混合模式:基础订阅费覆盖成本底线,用量阶梯在超阈值后计价——既避免重度用户把毛利吃穿,也让轻度用户感知便宜。

一个容易忽略的账:退款与滥用

上线三个月我们发现了"提示词注入盗取算力"的滥用模式——用户构造超长输入反复触发重推理。应对方案:输入长度硬限制 + 单用户单位时间 Token 配额 + 异常模式告警。成本安全是 AI 应用的新命题,传统风控团队没有这块经验,负责落地的工程师要主动补位。

结余:一本可以复算的账

现在每个月的成本报告长这样:分场景调用量、Token 用量、模型成本、缓存节约、单位经济模型(每次会话净成本)。财务看得懂,业务可归因,CEO 的那个问题,我现在 30 秒能答完。

做 AI 应用不会算账,就像厨师不尝菜。