衡量一个网页操作智能体是否可靠,关键不在于它能不能点对某一次按钮,而在于它能否独立办完一件事。客服与工具调用领域反复出现同一个规律:在单步、单轮的工具调用中,现代大模型表现相当稳定;一旦进入多轮、多步、需要跨页面保持状态的任务,成功率就会明显下滑。单步准确率衡量的是局部动作的正确性,而端到端成功率衡量的是整条任务链在累积误差下的存活能力,这两者描述的是完全不同的两种能力。
端到端口径的核心在于只认终态。只有最终结果完全符合预期才算成功,中途看似在推进、实则走偏的,一律计为失败。这种口径之所以更贴近真实可靠性,是因为任务链条越长,单步误差的累积效应越被放大。一个响应极快却在第四步点错链接的智能体,带来的返工和人工监督成本,可能远高于它节省的时间。单步准确率会把这类问题掩盖在漂亮的平均值之下,而端到端口径会直接把它暴露为一次失败。
公开基准的数据同样支持这一判断。据 MERJ 整理的研究资料,早期 WebArena 的 812 个任务中,2023 年评测配置下表现最好的 GPT-4 智能体端到端成功率仅为 14.41%,而人类为 78.24%;更接近真实环境的 Online-Mind2Web 覆盖 136 个真实网站上的 300 个任务,Operator 达到 61.3%,Claude 3.7 达到 56.3%。研究者特别指出,简单任务区分度很低,真正拉开差距的是更长、更复杂的任务旅程。这说明端到端成功率的价值恰恰集中在长链条场景——那正是企业落地时最该压力测试的区域。
因此,对正在选型的团队而言,比较响应速度或单步表现意义有限,更应算一笔总账:任务完成率、单位任务耗时、误操作次数以及人工接管次数。其中完成率必须坚持端到端口径,并对误操作做感知、定位、规划的分类归因。需要提醒的是,任何成绩都依附于特定环境、语言和模型版本,脱离可复现证据的排名参考价值很有限。只有当端到端完成率稳定、接管成本可控时,一个智能体才真正具备从试点走向规模化的条件。
