长流程智能体的测评,不能用一次演示是否成功来代替。真正可比的标准,必须同时回答三个问题:任务是否完成、过程是否可靠、成本是否可接受。否则,所谓“准确率”很容易掩盖工具误用、异常失控或人工反复返工等问题。
先统一任务边界
每个测试任务都应建立任务卡,明确任务起点、最终交付物、可用工具、业务规则、禁止行为和人工接管条件。测试方只规定目标与约束,不宜把每一步操作路径写死,否则测到的可能只是指令跟随,而不是智能体的规划与执行能力。
任务还必须区分标准、异常和边界场景。标准任务检验基本流程执行;异常任务加入数据缺失、工具报错、接口超时或权限不足;边界任务则考察预算接近上限、数据冲突和越权要求下,系统能否暂停并安全交给人工。
从结果指标转向过程指标
任务完成率应采用分级判定:完全完成、基本完成、部分完成和失败。关键步骤不能按普通步骤平均折算,例如付款、状态更新等环节失败,即使前序步骤全部完成,也不应被简单认定为高分。
工具调用需要拆分记录工具选择、参数、调用顺序、重复调用和副作用。日志至少应保留工具名称、输入参数、返回状态、错误信息与后续动作。异常恢复也不等于无限重试,合格表现应包括识别错误、有限重试、保留已完成结果,以及无法继续时的安全中止。
用重复测试建立可比性
比较不同智能体时,应固定模型版本、提示词、工具权限、数据集和运行环境,并对相同任务重复执行多轮。结果不能只报告平均成绩,还应呈现最差表现、失败步骤和失败原因分布。长流程的实际成本也应覆盖模型调用、工具调用、运行环境、人工接管和失败重做,而不能只看模型响应速度。
最终评分可以包含任务完成率、工具调用准确性、异常恢复、总耗时、综合成本、人工接管和安全边界,但总分不能掩盖高风险失败。一个系统即使普通任务表现良好,只要在权限校验或不可逆操作上发生越权,就不具备直接上线的条件。可比测评的核心,不是选出最会演示的智能体,而是确认谁能在统一约束下稳定交付、可追踪运行,并把人工介入控制在合理位置。