智能体安全证据链,不是一次模型测评报告,而是能够回答“测了什么、如何测、谁复核、上线后发生了什么、出了问题如何纠偏”的连续证据体系。它的核心对象也不是孤立的基础模型,而是模型、系统提示、工具配置、数据流、权限边界、运行环境和人工接管机制的组合。
证据链的核心构成
第一层是评估对象证据。企业应明确模型及版本、系统提示、检索库或记忆模块、上下文来源、可调用工具及参数范围,以及身份认证、审批链和数据边界。只测试聊天窗口中的回答,无法代表智能体实际调用工具和执行任务时的安全水平。
第二层是测试过程证据。内部测试应覆盖提示词注入、间接指令、恶意文档、敏感数据泄露、越权访问、不必要的工具调用、错误重试、目标漂移和高影响业务操作。每次测试都应保留输入样本、输出结果、工具调用轨迹、权限快照、人工判定和修复结论。无法复现的问题应标记为“证据不足”,不能直接归入安全。
第三层是运行行为证据。日志需要关联任务标识、用户身份、模型与策略版本、输入来源、工具名称及参数、返回结果、权限变化、异常重试、审批、撤销和人工接管动作,并记录任务最终造成的业务状态变化。证据不仅要完整,还要具备时间同步、完整性保护和访问审计能力;敏感内容可以分级脱敏,但不能破坏事件关联。
证据如何获得独立性
内部团队熟悉业务和架构,适合快速验证上线门槛,却可能受到项目进度和样本偏差影响。第三方驻场评估则用于检查内部结论是否遗漏关键风险,重点观察身份权限、数据库与代码仓库访问、工具调用网关、审批节点、沙箱、监控告警和日志真实性。第三方不应只给出总分,还应说明风险场景、复现条件、影响范围、残余风险和复测结果。
跨组织协作补足单个企业看不到的系统性风险,包括共享脱敏后的攻击模式和失败案例,统一风险分类与严重性分级,并明确模型提供商、云平台、应用开发者和使用企业的责任边界。共享内容必须注明测试条件、版本范围和复现限制,行业标准不能替代企业自身评估。
真正可用的安全证据链,应贯穿上线前、运行中和异常后:上线前证明控制措施存在,运行中证明系统按边界工作,异常后证明企业能够还原路径、及时止损并完成独立复测。安全结论只有在可复现、可追溯、可复核和可纠偏时,才具备管理与审计价值。