AI智能体的安全风险,不能只按模型输出是否准确来评估。与普通问答系统相比,智能体通常还涉及知识检索、工具调用、业务判断、数据写入和流程执行,因此风险会从“内容错误”扩展到数据泄露、权限越界、误操作和责任失控。评估对象应是“模型—数据—工具—流程—人员”组成的完整系统,而不是单独看模型能力。
先看四类核心风险
数据风险关注输入、检索和日志中的信息是否受到保护。企业需要确认数据存储、访问、删除和隔离机制,敏感信息能否脱敏,以及服务方是否明确数据使用边界。对于内部知识库,权限不能只停留在应用入口,还要避免智能体通过检索结果间接暴露无权访问的内容。
权限风险是智能体进入生产环境后的关键问题。系统应遵循最小权限原则,将“读取信息”和“修改数据”“执行操作”区分开来。涉及付款、合同、客户承诺或重要业务变更的动作,不宜由智能体直接完成,至少应设置人工确认、操作记录和异常告警。
内容风险不仅包括虚构信息,也包括引用失真、错误判断和不适当建议。评估时不能只看演示效果,应使用覆盖正常、边界和异常情况的小型验证集,观察任务完成情况、信息可追溯性、重复执行稳定性,以及人工复核和返工成本。
连续性风险则来自服务中断、接口调整、版本变化和供应商依赖。企业需要提前明确人工兜底流程,保留必要的替代方案,并确认在无法获取可靠资料时,智能体是停止执行还是自行补全。后者通常会放大业务风险。
把“可停止”纳入验收
安全评估不能只设置成功指标,也要设置停止条件:连续出现错误时自动暂停,触发权限边界时立即告警,缺少可靠依据时不得继续执行,敏感操作必须转人工处理,试点数据与生产数据保持隔离。所有关键动作都应能够追溯到输入、调用、决策和最终执行结果。
一个功能更强但边界模糊的智能体,未必优于功能较少却权限清晰、行为可追溯的方案。企业真正要判断的不是“它能做什么”,而是“它在什么条件下可以做、何时必须停、出了问题谁能发现并纠正”。只有这三个问题都能得到明确答案,系统才具备进入下一阶段试点的安全基础。