当企业管理者考虑把一部分重复性网页操作交给AI智能体时,最容易被打动的往往是演示视频:一句话指令,智能体就自动打开网页、点击、填表、整理出结果。但演示和可复现的日常办事能力之间,隔着一道不小的鸿沟。真正值得评估的不是它某一次跑得多顺,而是在同样任务反复运行时,任务完成率、耗时、误操作和人工接管次数能否稳定在可接受范围内。本文尝试给出一套可重复的沙盒测试思路,并结合近期公开基准的数据,说明该怎么比、以及比出来的结果有哪些边界。

为什么要把评测从"演示效果"转向"任务闭环"
网页操作类智能体的核心难点,不在于单步动作本身,而在于一个完整任务链条上的累积可靠性。客服与工具调用领域的测试已经反复出现同一个规律:在单步、单轮的工具调用中,现代大模型表现相当可靠;一旦进入多轮、多步、需要跨页面保持状态的任务,成功率就会明显下滑。换句话说,"能点对一次按钮"和"能独立办完一件事"是两种能力。
这也是为什么只比响应速度意义有限。一个响应极快却在第四步点错链接的智能体,带来的返工和人工监督成本,可能远高于它节省的时间。对企业而言,真正要算的是一笔总账:完成率、单位任务耗时、误操作造成的风险,以及为了兜底而投入的人工接管精力。
一组可复现的沙盒任务怎么设计
要让结果可比、可重复,关键是把任务固定在一个受控的沙盒环境里,而不是直接放到真实业务系统上。以下设计原则供参考。
任务类型分层
参考学术界对网页基准的分层思路,可以把测试任务按难度和性质分成三类:
- 信息查找类:在指定的本地化网站或镜像页面中检索某项信息并回填,例如"找到某产品页标注的保修期限"。这类任务链条短、容错高,通常是智能体表现最好的区间。
- 表单填写类:在不涉及真实提交的沙盒表单中,按给定资料填写多字段信息,考察它对输入框、下拉框、校验提示的理解与定位能力。
- 结果整理类:跨多个页面收集数据并汇总成一张结构化表格,这类长链条、多步骤任务最能拉开差距。
安全红线
整套测试必须坚持两条底线:不执行任何真实交易,不提交任何敏感信息。所有表单都指向沙盒或镜像环境,支付、登录凭证、个人隐私字段一律用占位数据替代。这既是合规要求,也是为了保证测试可以反复运行而不产生副作用。
评分口径
为避免"看起来做完了"的假象,建议把评分拆成几个相互独立的指标:
| 指标 | 定义 | 说明 |
|---|---|---|
| 任务完成率 | 最终结果完全符合预期的任务占比 | 以客观可验证的终态为准,而非中间步骤 |
| 单任务耗时 | 从接收指令到产出结果的墙钟时间 | 需剔除人工接管期间的等待 |
| 误操作次数 | 点错、填错、走错页面等偏离动作的计数 | 反映过程风险,即使最终完成也要记录 |
| 人工接管次数 | 任务中人类不得不介入纠正或推进的次数 | 直接对应监督成本 |
其中,完成率要采用"端到端"口径——只有终态正确才算成功,中途看似在推进但结果错误的,一律计为失败。这一点在公开基准里尤为关键。
公开基准给出的参照
虽然自建沙盒的数据不便直接对外排名,但近期公开基准可以提供量级参照,帮助校准预期。
据 MERJ 整理的研究资料,早期的 WebArena 基准包含 812 个任务,在 2023 年的评测配置下,表现最好的 GPT-4 智能体端到端成功率仅为 14.41%,而人类为 78.24%。需要强调的是,这组数字描述的是当时那套评测设置,并不代表当前前沿水平。
更接近真实网页环境的 Online-Mind2Web 基准,覆盖 136 个真实网站上的 300 个任务。在该论文测试的配置中,Operator 达到 61.3%,Claude 3.7 达到 56.3%,另有若干系统在 30% 左右。研究者同时指出一个重要现象:简单任务区分度很低,真正拉开差距的是更长、更复杂的任务旅程。此外,在桌面环境基准 OSWorld 的一组公开测试中,参与对比的几款计算机操作智能体在 127 个多步任务上的完成数量也存在明显差异。
这些数据共同说明两件事:第一,网页智能体近两年确有进步,但端到端可靠性离"无人值守"仍有距离;第二,任务越长越复杂,可靠性下降越明显,这正是企业落地时最该压力测试的区域。
结果的局限必须说清楚
任何一次沙盒实测的结论都有明确边界,评估者和决策者都应保持清醒。
其一,环境依赖性强。镜像站点与真实生产环境在反爬策略、动态渲染、弹窗验证等方面存在差异,沙盒成绩不能简单外推到线上。公开资料也显示,智能体在无 DOM 节点的画布应用、被当作按钮使用的 div、骨架屏加载等场景下的识别成功率明显偏低。
其二,语言与本地化会影响表现。有基准数据显示,同一智能体在英文环境与多语言平均成绩之间存在约 9 到 12 个百分点的差距。对面向中文业务的企业,直接套用英文测试结论并不稳妥。
其三,样本与版本时效性。模型迭代很快,任何一次测试都是对特定版本、特定日期的快照。因此,在缺少本方实测证据的情况下,不应对外宣称某款产品"排名第一"或"全面领先",公开基准数字也应标注来源与评测配置。
给评估者的实操建议
对正在选型的团队,建议把测试做成一个持续运行的流程,而不是一次性验收:固定任务集、固定评分口径、记录每个版本的四项核心指标并留存操作日志;对误操作做分类归因,区分是感知错误、定位错误还是规划错误;把人工接管次数折算成实际人力成本,再和宣称的提效比例做对照。只有当完成率稳定、接管成本可控时,才具备从试点走向规模化的条件。
【软盟资讯观察】
从趋势看,网页智能体正从"能演示"向"能办事"过渡,公开基准两年间从个位数、十几个百分点的成功率爬升到部分系统六成以上,方向是明确的。但从机会与风险的角度,更值得企业关注的是落地的务实路径:当下最先跑通的,大概率是信息查找、数据汇总这类链条短、可验证、低风险的场景,而涉及交易、提交、权限变更的高风险环节,仍应保留人工接管这道闸门。真正决定投入产出的,不是"有没有智能体",而是误操作率和接管成本能否压到可接受区间。一个冷思考是:当供应商都在强调完成率时,企业更应该追问评测环境、口径和版本——脱离可复现证据的任何排名,参考价值都很有限。把评测标准掌握在自己手里,比盲信任何一张性能海报都更重要。
