大模型采购正在从“看榜单选模型”转向“按场景定标准”,但多数企业仍缺少一套可执行的验收框架。榜单上的排名、公开的评测分数和厂商宣传的调用价格,在真实业务中往往对应着完全不同的实际表现。企业需要建立的不是一套复杂的评分体系,而是一组围绕业务目标、风险边界和长期成本的淘汰线。
验收标准的起点不是“哪个模型更强”,而是“模型能否稳定完成企业定义的业务任务”。以客服场景为例,模型不仅要理解用户问题,还要完成意图识别、知识库检索、工具调用和合规判断,任何一个环节出错都会导致任务失败。因此,验收标准应围绕“完整任务成功率”而非“单项问答准确率”来设计。企业需要把实际业务场景拆解为可验收的测试任务,明确输入格式、输出要求、判断标准和人工修改上限,而不是让模型在开放问题上自由发挥。
成本核算也需跳出“每千token单价”的简单对比。单位有效任务成本 = 模型调用成本 + 配套系统成本 + 人工处理成本 + 失败与重试成本。一个单价较低的模型,如果频繁需要人工修正结果、重试调用或增加辅助模型,最终总成本可能高于单价更高但一次完成率更好的模型。企业应在小规模测试阶段就按这一口径测算,避免在规模扩大后才发现经济性不成立。
稳定性测试同样不能只看平均响应时间。P95延迟、不同并发量下的首字节响应时间、超时和失败请求比例,这些指标才更接近用户在高峰期或复杂任务下的真实体验。测试数据应分为常规任务、边界任务、复杂任务和风险任务四层,每一层都包含脱敏后的真实历史样本,并让多个模型在相同输入、提示词和工具条件下进行盲测。
数据安全不是一句“不会用于训练”就能覆盖的。企业需要核对数据传输、存储、日志留存、人工审查权限、跨区域传输和子处理方等具体安排,并在合同中明确数据用途、保留期限、责任边界和退出机制。对于客户资料、源代码和财务信息等敏感数据,应先完成分类分级,再决定哪些可以进入模型、哪些必须脱敏。
最终的选型决策应采用“淘汰线”而非“总冠军”逻辑。先设定事实错误率上限、高风险任务人工复核要求、P95响应时间上限、单位有效任务成本上限等硬性红线,触碰任何一条的模型直接排除。通过淘汰线的模型,再根据成本、生态兼容性和供应稳定性综合选择。这样得出的结果,远比参考公开榜单更贴近经营现实。