人工接管率看似是在统计“有多少次需要人帮忙”,实际衡量的是:在既定任务、权限和验收标准下,智能体能否不依赖人工补救而完成工作。它不是智能体独立性的完整答案;若只看接管次数,可能把合理的安全审批误判为能力不足,也可能把大量人工修改隐藏在“任务已完成”之后。
一种可复核的口径是:接管任务率=发生实质性人工介入的任务数 ÷ 总任务数。这里的“实质性介入”应在测试前定义,例如补充关键信息、纠正错误、重启任务或手动修改结果。单纯查看进度不应自动算作接管;对高风险操作的必要批准,则宜单独记录,避免与故障补救混为一谈。
仅有任务率仍不够。同一任务可能被接管一次,也可能反复由人修正。因此还应记录接管次数、介入原因、人工介入时间,以及介入后是否通过验收。这样才能区分“偶发确认”与“实际由人完成大部分工作”。任务完成率也要并列报告:低接管率但结果不合格,并不代表独立性强。
比较不同智能体时,任务输入、权限、提示词和验收标准应尽量一致;无法统一的条件要披露。任务难度不同,也不宜直接把总体接管率排成名次。更有解释力的做法,是按任务类型呈现接管情况,并查看失败样本和介入原因。
因此,人工接管率更适合作为诊断指标,而非单一排名指标。真正有意义的“独立”,不是从头到尾没有人出现,而是在明确边界内稳定完成可验收工作;该交给人判断时能及时停下,交付后也不需要人替它收拾结果。