企业核算大模型成本,最容易犯的错误是只看 API 单价。真正需要管理的是“有效结果成本”:一个结果不仅要生成,还要满足准确性、格式、业务规则和安全要求,并能够被流程实际采用。若输出需要人工大幅修改、重复调用或重新检索,它就不能被视为低成本结果。
先定义什么是有效结果
企业应先为每类任务设定验收标准。例如,知识问答要看事实是否正确、引用是否可核验;内容生成要看格式遵循率和人工修改时间;代码辅助要看缺陷定位或测试用例是否可用。只有达到标准、无需大幅返工的输出,才计入有效结果。
因此,核算对象不应是“调用次数”,而应是“有效完成的任务数”。请求总量可能包含测试、失败重试和无效调用;调用量高,也不代表业务产出高。至少需要持续记录有效请求数、任务完成率、重试率、平均输入输出 Token,以及人工复核和修改比例。
建立完整成本公式
可采用两层口径。单位任务总成本为:
模型调用费用 + 检索与工具费用 + 人工复核费用 + 失败重试费用 + 系统运维费用
在此基础上,有效结果成本为:
有效结果成本 = 单位任务总成本 ÷ 有效结果数量
其中,人工成本往往被低估。一个报价较低的模型,如果经常出现事实错误、格式错误或上下文理解偏差,就会增加审核、返工和再次调用;最终成本可能高于单价更高、一次完成率更好的模型。
把成本核算嵌入选型
企业应使用真实业务测试集,而不是只依据公开榜单。评估时同时观察准确性、响应速度、稳定性、人工修改时间和高峰期表现,再将模型按任务分层:复杂推理使用能力更强的模型,分类、摘要和信息抽取使用高频模型,敏感数据则考虑本地或私有化部署。
最终比较的不是哪个模型“最便宜”,而是哪个方案在特定任务上以可接受的风险,持续产出更多有效结果。模型网关、日志监控和多模型路由也应保留,以便在价格、性能或服务发生变化时重新核算,而不是被单一供应商锁定。