企业核算模型 API 成本,不能停留在“每百万 Token 多少钱”。真正影响预算的,是一次调用消耗了多少输入和输出 Token、缓存是否命中、失败后是否重试,以及最终结果能否直接用于业务。更适合管理模型投入的指标,是“单位有效结果成本”:获得一个合格结果所支付的综合成本。
先建立完整成本口径
基础核算可写为:模型调用成本 = 输入 Token 成本 + 输出 Token 成本 + 缓存相关成本 + 其他调用费用。若涉及批处理、文件解析、工具调用或联网能力,也应纳入同一张账表。输入内容包括提示词、历史对话、检索结果和业务规则;输出内容则包括回答、结构化结果与工具调用信息。长文档分析往往输入占比更高,内容生成则可能由输出成本主导,不能用单一单价推算总账单。
企业至少要按业务场景记录调用量、平均输入与输出 Token、较长请求的占比、缓存命中率、失败重试次数,以及不同模型和套餐的实际价格。平均值用于观察日常支出,长尾请求则用于识别预算偏差。缓存也不能简单视为优惠,必须确认哪些内容可缓存、缓存何时失效、写入与读取如何计费。
把“有效”纳入成本公式
单位有效结果成本不能只看 Token 消耗,还应结合合格结果率、重试率和人工复核比例。可用以下思路核算:
单位有效结果成本 = 总调用及相关运营成本 ÷ 合格结果数量
其中,相关运营成本包括模型费用、失败重试、人工复核和必要的工程处理。若某模型单价较低,却经常输出不完整内容,导致二次调用或人工修订,其真实成本可能高于标价更高但一次通过率更好的模型。
因此,企业应针对客服问答、合同摘要、营销文案、数据抽取等场景分别评估,不宜用一个平均指标覆盖所有业务。低风险、高频任务可重点观察价格和吞吐;复杂推理或高风险任务则应提高对质量稳定性和可控性的权重。
价格变化也不等于必须迁移。迁移前要把接口适配、提示词重写、质量评测、团队培训、故障切换和回滚机制纳入成本。更稳妥的做法,是先在低风险场景进行小流量对照,设置合格率、重试率和单位有效结果成本的停止条件,再决定是否扩大流量。这样得到的不是静态价格表,而是一套能随业务变化持续修正的成本账本。