智能体安全验收,不能被简化为查看一张评测报告或一个“通过”结论。企业真正需要验收的是:智能体在恶意指令、数据越权、工具误用和异常任务条件下,是否仍处于可控边界内,并且在发生错误时能够被发现、阻断、追责和恢复。
《智能体安全评测基准V1.0》覆盖45个攻击场景,可作为企业建立验收口径的参照。但“45个场景”不是45个独立漏洞,也不等于系统获得绝对安全证明。验收重点应从场景数量转向风险链条:模型能否抵御提示注入和多轮诱导,知识库是否存在跨用户、跨权限泄露,工具调用是否经过身份与权限校验,高风险操作是否支持人工确认和紧急中止。
把评测结果变成验收证据
企业可按四个阶段推进。供应商材料审查阶段,应确认被测对象究竟是基础模型、智能体产品,还是已经接入工具、知识库和业务系统的完整方案,同时核对模型版本、测试环境、权限配置、覆盖场景和复测记录。只有总分而没有测试条件、原始证据和失败样本的报告,难以直接用于验收。
场景化复测阶段,应使用企业自己的数据边界和业务流程验证高风险任务,重点检查智能体能否访问不属于当前岗位的数据,能否绕过人工审批执行操作,能否被外部文档或网页内容诱导,以及异常发生后能否停止并保留完整审计记录。复测不能只保存对话截图,还应记录输入、输出、工具调用、权限状态和系统日志。
上线前,安全要求应进入合同、验收标准和服务协议,明确必测场景、重大风险整改时限、模型或插件变更后的重新评估条件、日志留存、人工接管和安全事件通报机制。指标也不能只看拒答率,还要兼顾安全性、准确性、可控性和业务连续性。
验收必须延伸到持续运营
智能体接入知识库、办公系统或外部工具后,系统边界会随数据、权限和流程变化而变化。因此,验收通过并不意味着生命周期结束。企业应建立定期复测、变更触发复测、异常样本回放和权限审计机制,并为高风险操作保留人工中止与紧急停用能力。真正合格的智能体,不是“从不犯错”,而是即使犯错,也不会在无人知晓、无人干预的情况下持续扩大影响。