网页智能体的接管率该如何计算?

话题来源: 主流AI智能体网页任务实测:如何比较任务完成率、人工接管与权限风险?

网页智能体的接管率,核心不是统计它“求助了几次”,而是衡量多少次任务执行必须由人介入才能继续或完成。若口径不先定义,产品可能把人工代做算作成功,也可能把一次任务中的多次求助重复计数,导致结果无法比较。

建议以单次任务执行为统计单位,按任务次数计算:

接管率 = 需要人工接管的有效任务次数 ÷ 有效任务执行总次数 × 100%

“需要人工接管”应在测试前明确:例如,智能体暂停并要求人完成关键操作,或测试人员必须接手点击、输入、判断或恢复流程,才可能继续任务。仅提示“已完成”不构成接管;但若智能体实际无法推进、由人代为完成,即使最后结果正确,仍应计为接管。一次任务中发生多次人工介入,在任务级接管率中只计一次,同时另行记录介入次数和发生步骤。

分母应是按预设方案启动、且条件符合要求的有效执行次数。页面故障、账号权限错误等外部原因是否剔除,必须事先规定并逐次注明,不能在看到结果后再选择性排除。任务被剔除时,也应单独报告数量与原因,避免分母变化掩盖失败。

接管率不能单独说明智能体表现。最好并列报告任务完成情况,并区分“无人介入完成”“接管后完成”和“接管后仍未完成”。前者反映自主执行能力,后两者则呈现人工介入的作用;若把接管后完成统一算作智能体独立完成,指标会失真。

比较不同任务时,还应分别统计公开网页查找、登录后操作、表单填写等场景,避免任务难度和授权要求不同却合并成一个数字。发布结果时同时列明有效任务数、接管判定规则、任务类型和逐次记录。接管率由此才是可复核的测量口径,而不是脱离场景的单一排名。

发表回复

登录后才能评论