企业建立大模型任务成本基线,不能从“每百万词元多少钱”开始,而应从真实业务任务开始。模型采购的计费单位是词元,企业承担的却是一次完整交付:读取上下文、检索资料、调用工具、生成结果、失败重试,以及必要的人工复核。只有把这些环节纳入同一账本,成本数据才具有决策价值。
首先要定义可重复的任务单元,例如处理一张客服工单、完成一次合同审阅或生成并调试一段代码。每类任务都应固定输入材料、验收标准和成功条件,同时记录以下指标:单次输入与输出词元量、平均及最大调用轮次、工具调用次数、失败与重试情况、响应时间、任务成功率和人工接管率。对于智能体,还要记录是否重复读取相同内容,以及调用链是否因判断不稳定而持续延长。
成本基线可采用一个完整的核算框架:
单位任务成本 = 模型调用成本 + 检索与工具成本 + 重试成本 + 算力与运维成本 + 人工复核成本
这不是固定不变的财务公式,而是防止遗漏成本的管理口径。基线至少应同时覆盖平均成本与异常成本。平均值适合估算日常预算,最大调用轮次、长上下文和异常重试则决定高峰期是否可能出现成本失控。
建立基线时,不能只测试“答案是否正确”,还应在相同任务集上比较不同模型和流程设计:更换模型后,调用次数是否下降;压缩上下文后,效果是否明显受损;增加检索或工具后,业务收益是否足以覆盖新增开销。对于分类、摘要、格式转换等任务,可优先评估成本更低、响应更快的模型;复杂规划和高风险审核,则需要衡量更强能力带来的实际收益。
基线不是一次性报表,而是持续运营的参照。模型、价格、提示词和业务流量发生变化后,应重新观察词元消耗、延迟、错误率与人工介入情况。企业真正需要建立的,不是某个模型的静态报价,而是“完成一项任务要花多少钱、为什么花这些钱、如何在不降低交付质量的前提下把它降下来”的可追踪机制。