当一款新旗舰模型发布时,官方公布的基准成绩往往只能说明它在通用能力榜单上的相对位置,却无法回答一个更关键的问题:它在你的业务流程里到底能完成多少任务。同一模型在不同任务上的绝对完成度可能相差悬殊——某法律智能体基准上接近五分之一的完成率,与某自动化基准上过半的得分并存,恰恰说明"领先竞品"与"真正可用"是两套彼此独立的信息。企业要在这种落差中做出理性判断,唯一可靠的依据,是一套可复现的私有评测集。
可复现的前提是任务来源于真实业务,而非照搬公开榜单。评测集应从企业高频、关键的实际任务中抽取,覆盖长链条执行、反复验证的专业场景,并明确记录每条样本的输入、预期产出与判定标准。关注点要从排名转向完成度:模型是否完整走完了多步流程、输出是否可直接接入下游环节,比它在某个维度上领先多少分更有价值。
固定变量,才能比较
复现性意味着每次评测的条件可追溯、可重放。调用参数、采样设置、单次尝试还是多数表决、输出长度上限,都应作为固定变量记录在案。官方评估通常采用单次尝试(pass@1)、不使用多数表决或并行算力的口径,企业若要横向对比不同模型,就必须让自己的评测保持同样一致的设置,否则分数之间不具可比性。评判环节也应尽量减少主观波动,为开放式产出预先约定可核验的通过条件。
把成本算进评测
评测不只是衡量能力,还要衡量代价。长输出能力为长链条任务打开了空间,但输入与输出 token 往往定价不同,缓存折扣也有其适用条件,这些都会直接改变实际调用开销。将真实任务的平均调用量、输出规模纳入评测记录,才能在能力与成本之间得到贴近落地的结论。
需要清醒的是,厂商自评、媒体转述与独立实测尚未闭环之前,排名领先并不构成采购依据,部分前沿模型甚至仍处于受控访问、未正式开放的阶段。真正能回答"是否适配我的流程"的,始终是企业自己维护的、可重复运行的验证集,而不是任何一张发布会海报上的数字。
