大模型 API 成本不能只看输入、输出 Token 的单价。企业真正需要核算的,是一次调用从请求发出到形成有效业务结果所产生的全部成本:模型费用、失败重试、上下文膨胀、接口适配、人工复核,以及必要的数据安全与运维投入。单价低,不等于单任务成本低;如果输出经常需要修改,节省的 Token 费用可能很快被人工成本抵消。
先算模型调用费
基础公式可以写成:
月度模型成本 ≈ 月调用次数 ×(平均输入 Token × 输入单价 + 平均输出 Token × 输出单价)+其他服务费用
平均输入 Token 不只是用户问题,还可能包括系统提示词、历史对话、检索内容、业务规则和工具返回结果。知识库问答、客服和多轮对话尤其容易出现“问题很短、上下文很长”的情况,因此不能用单次简单问答的用量直接推算生产预算。
计费规则还要确认输入与输出是否分别计费,缓存命中、批量任务、长上下文、文件解析和工具调用是否适用不同规则,以及失败请求、超时请求和重试请求是否产生费用。平台接入与直接调用也可能属于不同计费体系,不能仅凭套餐名称或页面上的单价进行比较。
再算有效结果成本
更有决策价值的指标是“每个有效业务结果的成本”。例如,一次摘要调用虽然成功返回,但如果还需要人工大量校正,就应把人工复核时间纳入核算;如果接口超时导致重复重试,也应记录重试次数和额外 Token 消耗。对于高风险业务,还要考虑审核、兜底和异常处理带来的成本。
建议建立低负载、典型负载和高峰负载三组样本,分别记录平均输入长度、平均输出长度、失败率、重试次数、响应时间和人工修改比例。测试时固定提示词和业务样本,并保存接口版本、调用时间与账单记录,避免只凭少量体验判断全年支出。
用单位业务成本做决策
最终应把总成本除以有效结果数量,而不是只比较每百万 Token 的价格。若某模型输出更短但准确性不足,可能增加人工处理;若某平台接入便宜,却需要较多接口改造和运维,也未必更经济。
因此,预算核算至少要回答三个问题:每次调用平均消耗多少 Token,多少调用能够形成有效结果,以及失败、重试和人工复核会增加多少成本。只有这三层数据同时成立,API 价格才具有实际决策意义。