判断智能体是否自主完成,不能只看最终结果是否正确,还要追问:目标状态是谁实现的,中途是否有人改变了任务、修正了内容或代替它执行操作。只要人工补救被计入“成功”,完成率就会掩盖智能体的真实能力边界。
可先把“自主完成”定义为:智能体在预先给定的任务、权限和规则内,独立达到全部成功条件;测试人员没有暗中补充指令、修改结果或手动完成步骤。相应地,“人工补救”包括补充必要信息、纠正错误内容、代为操作,或在失败后接手完成。仅生成合理建议不等于完成跨应用任务,还需核对目标应用中的实际状态,以及相关对象、内容和约束是否正确。
安全确认应单独记录,不能一概算作补救。若测试流程预先规定关键操作须由人授权,这属于授权门槛;若智能体因无法继续而要求人工处理,则属于接管。两者都意味着任务并非完全自主,但原因不同,报告时应分开标注,避免把正常的安全控制误判为能力缺陷,也避免把人工接管包装成自主成功。
最可靠的判定依据是操作轨迹与应用状态变化,而不是演示过程或口头说明。记录每次人工介入发生在哪一步、做了什么、为何介入;同时检查智能体是否识别错误、保留已完成内容、避免重复操作,并在恢复后达到目标。这样才能区分“自行恢复”和“人帮忙兜底”。
最终至少应分别报告满足全部条件的任务比例,以及无需人工介入的自主完成比例;再说明接管原因和判定口径。若一次任务经人工修改后成功,应记为“人工介入后完成”,而不是自主完成。只有把结果、过程和介入边界同时纳入评价,测试成绩才真正说明智能体能独立承担到哪一步。