网页调研智能体的演示效果,不等于它能稳定完成一项可核验的研究任务。真正值得比较的,不只是回答得快不快,还包括关键信息是否正确、引用能否回到原始页面、遇到相互矛盾的说法是否说明依据,以及出错时是否及时请求人工接管。由于现有可核验资料没有提供多个产品在同一任务下的原始结果,本文不虚构实测成绩或产品排名,而给出一套可复现的对比方案,并说明如何解读已有基准测试。
先固定任务,再比较智能体
建议使用一份明确、可重复执行的任务单,例如:从预先指定的三家产品官网及其帮助文档中,整理某一功能的支持范围、适用限制和最近一次更新时间;每项结论都附上原始页面链接和对应依据。任务应包含相同的起始页面、问题清单、输出格式和截止条件。不要只写“调研某领域并总结”,否则不同智能体可能各自选择网页、扩大范围,结果便难以公平比较。

测试前还要锁定浏览器环境、网络条件、登录状态、任务提示词和可用工具。若产品无法使用相同底层模型或浏览器配置,应记录差异:此时测到的是整套产品方案的表现,不能把差异简单归因于智能体本身。
每个智能体至少重复执行五次,并保留完整过程记录。五次并非通用的统计标准,但有助于暴露偶然成功、网页波动和重复执行不稳定等问题。若任务涉及动态页面,还应标注测试时间,避免把页面更新导致的差异误判为智能体能力差异。
评分不只看答案,也看证据链
先把任务拆成可核验的关键事实,例如功能是否支持、限制条件是什么、更新时间对应哪一页。由人工依据指定来源制作标准答案,并在评分前确定每项事实的权重,避免看完结果后再调整口径。
| 观察项 | 建议记录方式 | 重点判断 |
|---|---|---|
| 关键信息准确率 | 正确的加权事实数 ÷ 应回答的加权事实总数 | 是否答对;缺失、错误和无依据结论分别记录 |
| 来源核验 | 核对链接、页面主体及页面内容 | 链接是否可打开,是否支持对应结论,是否引用到原始来源 |
| 冲突处理 | 记录相互矛盾的页面及智能体的处理方式 | 是否标出分歧、时间差或口径差,而非擅自选一个答案 |
| 完成耗时 | 记录从启动到提交的墙钟时间 | 同时报告等待网页、重试和人工检查所耗时间 |
| 人工接管 | 记录每次接管的原因、次数和用时 | 是否因登录、验证码、权限、页面异常或不确定性而求助 |
| 可追溯性 | 抽查结论与页面、段落或证据的对应关系 | 另一位审核者能否独立复核,而不必重新做完整调研 |
准确率最好不要把所有事实简单计为“对或错”。例如,引用了正确网页却把适用范围说反,仍应记为事实错误;链接存在但页面没有支持该结论,应记为来源不匹配;遇到来源冲突却明确说明冲突和依据,则不应与无依据猜测同等处理。人工接管也不必一概视为失败:在权限不足或安全边界不明时及时暂停,可能比继续操作更可靠。应同时报告接管次数、人工处理时间和触发原因。
冲突信息要看处理过程
网页调研常见的问题不是“找不到答案”,而是多个页面给出不同口径:产品介绍页与帮助文档更新不同步,旧公告与新文档描述不一致,或页面只覆盖部分地区和用户类型。测试时应预先规定来源优先级,例如优先采用当前官方文档,并将官方公告、帮助中心和第三方页面分别标记;若仍无法判定,就要求智能体保留冲突并说明不确定性。
结果表中,每条结论都应对应来源、页面日期或抓取时间,以及支持结论的具体内容。仅列一串网址不足以证明答案可追溯。审核者还应抽查“结论—证据”是否一一对应,特别关注智能体是否把页面标题、搜索摘要或相邻段落误当作直接证据。
已有基准能提供什么,不能提供什么
一篇关于浏览器智能体的测试文章介绍了 Online-Mind2Web 基准:其中包含 300 项任务,覆盖 136 个网站。文章称,测试比较了参考浏览器智能体与语义智能体,每项任务各执行五次,并报告后者在其测试设置下的速度和成本改善。该结果可作为“多网站、重复执行”的测试设计参考,但它比较的是特定系统和工作流程,不能直接说明其他产品的事实准确率、人工接管成本或综合排名。 《The Missing Piece for Browser Agents》
因此,团队发布对比结果时,应同时公开任务单、测试日期、环境配置、评分口径、失败样例和重复次数。若只能披露汇总分数,读者无法判断差异来自任务、模型、网页环境,还是人工介入规则;一个数字也就很难成为可复核的产品结论。
【软盟资讯观察】
趋势判断:网页调研智能体的评估正在从“能不能打开网页并生成摘要”,转向“能不能把结论和证据连起来”。对企业而言,这让智能体有机会进入竞品监测、供应商信息整理和内部知识更新等流程,但前提是来源与过程可审计。
机会与风险:可复现的任务集、证据标注和接管日志,可能比一次演示更能帮助团队选型,也能为后续质量改进提供依据。风险在于,不同产品的模型、浏览器权限和失败处理机制往往并不一致,单一任务上的速度优势未必代表真实工作流中的总体收益。
冷思考:人工接管不是只需压低的成本指标。涉及账户权限、敏感信息或相互矛盾的证据时,智能体知道何时停下并交给人,可能比勉强给出完整答案更重要。评估的重点应是风险是否可控,而不只是自动化比例有多高。
