多智能体系统里,每个智能体都能答对问题,不等于组队后就能完成任务。OpenAgents与哥伦比亚大学、宾夕法尼亚大学、首尔大学和宾夕法尼亚州立大学研究人员提出的AgentWorld评测基准,将测试重点放在长任务中的角色分工、信息交换和资源协同。相关报道概括其结果称,即使使用能力较强的模型组队,受测协作任务的完成率也仅在约一半的水平。这个数字描述的是特定基准下的表现,不能直接换算为企业业务流程的成功率。
评测关注的是“团队能否交付”
据AgentWorld论文,研究者关注现有评测容易偏向短轮次交互、竞争场景或个体能力汇总的问题。AgentWorld让不同角色在资源不对称、需要持续交互的任务中合作,考察团队是否能把信息和行动衔接起来,而不只是看单次回答是否合理。

这也解释了为什么单体Agent的高分不能替代多智能体协作评测。一个智能体可能擅长规划,另一个擅长调用工具;但如果前者不知道后者实际拥有什么资源,或者交接信息在数十轮任务中丢失,团队仍可能无法完成最终目标。
企业应重点排查四类协作失败
对部署团队来说,值得复盘的不只是“有没有给出答案”,还有过程中的重复询问、认错角色或资源、传递错误的物品信息,以及关键步骤尚未完成就宣布任务结束。这些现象分别指向状态记忆、职责边界、信息校验和结束条件的问题。它们也可能相互叠加:一条错误的资源信息被后续智能体当成事实,最终让整条任务链偏离目标。
企业Agent选型因此需要把两组指标分开:单体能力看理解任务、规划和工具使用;团队能力看交接是否准确、冲突能否被发现、长任务中是否保留必要状态,以及最终结果能否被独立核验。演示中的流畅对话,不能代替端到端完成率。
可执行的验证方式是选取一组有明确验收标准的真实业务任务,固定模型、工具权限和任务难度,分别测试单Agent方案、多Agent基础方案,以及加入明确角色分工、共享记忆和通信规则后的方案。记录每轮消息、工具调用和资源状态,统计最终完成率,同时标注重复劳动、错误交接、过早结束与人工接管次数。只有在相同条件下对照,才能判断新增协作机制是否真正带来收益,而不是仅仅增加调用成本。
【软盟资讯观察】
AgentWorld的价值,不在于给所有企业Agent方案划出一条统一的“及格线”,而在于提醒采购方:多智能体协作是一项需要单独验证的系统能力。随着任务链变长,智能体之间的状态同步、权限边界和结果验收,可能比再增加一个擅长对话的角色更影响交付质量。
机会在于把协作做成可观测、可回放、可改进的流程:先定义谁负责什么、哪些信息必须共享、何时必须等待确认,再用对照实验验证改动。风险则是将基准中的约一半完成率直接当作某款产品的可用性结论,或只挑成功演示替代批量测试。对企业而言,稳妥的推进顺序是先限定低风险场景与人工兜底条件,再逐步延长任务链;能解释失败原因并持续提高真实完成率,才比“Agent数量更多”更有采购意义。
