2026年5月8日,国家网信办、国家发展改革委、工业和信息化部联合印发《智能体规范应用与创新发展实施意见》。文件将任务理解、任务规划、工具使用、长期记忆、互认互通、群体协同列为需要加强技术攻关的关键方向,并提出完善智能体工具链、健全标准体系。对企业而言,这释放出的明确信号是:智能体选型不能再主要围绕模型参数和单轮问答效果展开,而要转向评估能否在权限可控的前提下完成真实任务闭环。

政策关注点:智能体不只是一个模型
《实施意见》将智能体定义为具备自主感知、记忆、决策、交互与执行能力的智能系统,并提出坚持安全可控、规范有序、创新驱动、应用牵引。文件同时提出,面向智能体训练与运行提升高质量数据集供给能力,加强任务理解、任务规划、工具使用、长期记忆、互认互通、群体协同等技术攻关,提升智能体泛化能力。
这些表述的技术含义在于,智能体的能力边界已经从“能否生成一段答案”,延伸到“能否理解目标、制定步骤、调用系统、保留必要上下文,并与其他智能体或系统协同完成任务”。
企业因此需要把模型能力和系统工程能力拆开评估:
- 模型能力主要体现为理解指令、生成内容、推理判断和处理复杂语义的能力。
- 系统工程能力则涉及任务拆解、流程编排、工具调用、状态管理、记忆治理、权限控制、异常处理和审计追踪。
- 业务落地能力还包括与现有系统的集成、数据质量保障、人工复核机制以及上线后的运营维护。
如果采购测试只比较模型回答是否流畅,容易忽略真正影响业务结果的后两层能力。
从“看参数”转向“看任务闭环”
企业AI选型首先应从具体业务任务出发,而不是先确定模型,再寻找应用场景。一个相对完整的评估对象,应包括以下环节。
1. 任务理解:能否识别真正目标
任务理解不等于关键词匹配。以售后处理为例,员工输入“这个客户已经催了三次,尽快处理”,系统需要识别客户、订单、问题类型、紧急程度和可采取的动作,而不是简单生成一段安抚话术。
采购测试可以设置三类指标:
- 对业务目标、约束条件和优先级的识别准确率;
- 面对不完整、含糊或相互矛盾指令时的澄清能力;
- 对不应执行任务的识别能力,包括权限不足、信息缺失和风险过高等情况。
这部分既依赖模型,也依赖企业知识库、上下文注入和业务规则。测试时不能只给标准化提示词,还应加入真实工作中的省略表达、口语表达和异常输入。
2. 任务规划:能否把目标转成可执行步骤
任务规划是智能体与普通问答助手的重要分界。企业应观察系统能否将复杂目标拆分为步骤,并根据中间结果动态调整,而不是一次性生成看似完整的计划。
可验收的指标包括:
- 任务拆解是否覆盖关键环节;
- 步骤之间的依赖关系是否正确;
- 工具调用失败后能否重试、改道或请求人工介入;
- 是否能够在达到目标、触发风险或缺少信息时及时停止;
- 计划变更是否有原因记录,便于复盘。
这里需要特别区分“计划文本质量”和“任务完成质量”。一份结构清晰的计划,不代表系统真的能完成采购申请、合同核验或工单流转。最终验收应以端到端成功率、关键步骤错误率和人工接管率为主。
3. 工具使用:能否安全连接企业系统
《实施意见》提出完善智能体工具链。对企业而言,工具使用不是简单增加几个API,而是要建立从工具注册、参数校验到结果返回和权限审计的完整链路。
采购和架构设计至少要回答几个问题:
- 工具的输入参数是否有严格格式校验?
- 智能体能否区分查询、修改和高风险操作?
- 不同员工、部门和业务角色是否拥有不同权限?
- 执行付款、发货、删改数据等动作前,是否必须人工确认?
- 工具调用失败、超时或返回异常数据时,系统如何处理?
- 每次调用是否保留调用者、时间、参数、结果和审批记录?
对于工具调用,不能只测“调用成功率”。更重要的是误调用率、越权拦截率、错误参数拦截率、关键动作人工确认覆盖率,以及异常情况下的数据一致性。
在高权限场景中,智能体应默认采用最小权限、分级授权和可撤销机制。能调用工具不等于可以自主执行所有工具,能生成操作建议也不等于应直接改变业务数据。
长期记忆不是“记得越多越好”
长期记忆涉及用户偏好、业务规则、历史任务和组织知识的持续保存。它可以减少重复沟通,但也会引入隐私泄露、错误记忆长期传播和权限边界模糊等问题。
企业评估长期记忆时,应重点检查四个方面:
- 记什么:哪些信息可以长期保存,哪些只能在当前会话中使用;
- 存多久:是否有保留期限、过期机制和删除入口;
- 谁能用:个人、团队、部门和企业级记忆是否分层隔离;
- 如何纠错:用户能否查看、修改和撤回错误记忆。
评测指标可以包括记忆召回准确率、无关记忆干扰率、跨用户泄露率、过期信息命中率和删除请求完成率。对企业来说,长期记忆的价值不是让系统“更像一个熟人”,而是让它在正确权限和明确生命周期内,稳定利用与任务相关的信息。
互认互通与群体协同:先看边界,再看效率
文件将互认互通、群体协同纳入关键技术攻关,意味着企业未来评估智能体时,不能只看单个智能体的能力,还要关注它与其他系统、智能体和业务流程的协作方式。
不过,互认互通并不等于无条件开放。企业需要明确:
- 不同智能体如何识别彼此的身份、能力和权限;
- 任务如何分派,结果如何回传;
- 一个智能体是否能够代表另一个智能体执行操作;
- 协作过程中的责任如何追踪;
- 某个节点失效时,任务能否暂停、回滚或转人工。
群体协同的评测不应只看并行任务数量,还应关注协同后是否出现重复执行、责任不清、信息污染或权限扩散。对多数企业而言,先把单一业务流程的闭环和审计做好,再逐步扩大智能体协同范围,比一开始追求复杂的多智能体架构更稳妥。
企业采购可采用“四层验收表”
为了避免供应商只展示演示效果,企业可以将验收拆成四层:
| 验收层级 | 重点问题 | 可参考指标 |
|---|---|---|
| 认知层 | 能否正确理解任务和约束 | 意图识别率、澄清率、拒答准确率 |
| 规划层 | 能否形成并调整执行步骤 | 计划完成率、关键步骤错误率、重规划成功率 |
| 执行层 | 能否可靠调用工具和业务系统 | 工具调用成功率、参数错误率、越权拦截率 |
| 治理层 | 是否可控、可查、可纠错 | 审计覆盖率、人工接管率、数据泄露事件、记忆删除完成率 |
指标必须绑定真实业务流程和风险等级。比如,内部知识问答可以允许较高的人工复核比例;财务、供应链、人力和客户数据场景,则应提高权限控制、日志留痕和关键动作审批的权重。
同时,企业要在合同和项目验收文件中明确测试数据、异常场景、服务等级、故障责任、数据归属和退出机制。没有这些约束,所谓“准确率”和“自动化率”很容易变成无法复现的演示数据。
部署前要治理三类风险
《实施意见》指出,智能体的高自主性、高权限特性可能带来隐私泄露、越权操作、行为失控等安全风险。企业在部署前至少要完成三类治理。
第一是权限风险。 将读取、生成、修改和执行权限分开管理,对高风险动作设置审批、二次确认或人工接管。
第二是数据与记忆风险。 对训练数据、检索数据、会话数据和长期记忆进行分类分级,明确访问边界、保留期限和删除机制。
第三是行为失控风险。 建立停止开关、调用限额、异常检测、回滚机制和人工接管流程,并通过越权提示、恶意输入、工具异常和连续失败等场景进行压力测试。
这些机制不应在项目上线后再补充。政策强调安全、可靠、可信要贯穿技术研发、应用部署与推广全过程,企业也应把安全控制写进架构方案和验收标准,而不是只作为合规材料。
编辑观察:选型核心变成“可控地完成任务”
从《实施意见》的技术要求看,智能体政策关注的并不是某个模型的单点性能,而是围绕任务完成建立技术底座、工具链、标准协议和治理体系。对企业管理者和技术负责人来说,选型逻辑至少要发生三点变化:
一是从比较模型参数,转向比较真实任务的端到端结果;二是从购买一个“会对话的产品”,转向建设模型、工具、数据、权限和运营共同组成的系统;三是从追求完全自动化,转向在可解释、可审计、可接管的前提下逐步扩大自动化范围。
《实施意见》并未替企业指定具体厂商或统一验收数值。因此,企业当前最可执行的做法,不是等待一个通用排名,而是先选定高价值、低风险的业务流程,建立任务基准集和异常场景集,再用可量化指标验证智能体是否真正完成了任务闭环。此后,才有必要讨论模型替换、工具扩展和多智能体协同。
权威来源:
关于文章版权的声明:
https://news.softunis.com/75119.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

