AI代理从辅助工具走向自主执行者后,安全治理的核心问题发生了位移:过去关注“系统是否被攻破”,现在更棘手的是“如何判断代理的一次操作是合法履职还是被劫持后的恶意行为”。要回答这个问题,不能依赖单点防护,而需要为代理建立一套可验证、可追溯的行为基线,并且让这条基线覆盖从身份到结果的全链路。
建立行为基线的第一步,是给每个AI代理一个独立的数字身份,并遵循最小必要权限原则分配权限。代理不应该继承人类账号的全部权限,更不应该拥有一个“万能”的系统账号。它的身份应当与具体任务绑定,权限范围精确到能完成任务的边界即可。这一步的意义在于,当代理行为出现异常时,安全团队能够快速定位是哪个代理、在哪个环节出了问题,而不是面对一个模糊的超级权限实体无从下手。
身份确立之后,关键在于为代理建立“正常活动模式”。这需要借助用户与实体行为分析技术,将人类用户和AI代理分别建模。人类的行为模式相对稳定,而代理的行为往往更规律、更可预测——它通常只访问固定的API、在特定时间窗口执行任务。一旦代理开始调用从未访问过的内部接口,或在短时间内发起大量数据导出请求,这种偏离基线的行为就应当触发告警甚至自动熔断。难点在于,SOC的工具链必须能够统一解析人类与代理的行为日志,如果两者被割裂在不同的监控系统中,异常检测就会出现盲区。
行为基线不仅要覆盖代理自身,还要延伸到它依赖的资源。代理调用第三方模型API或开源模型时,供应链风险同样需要纳入治理范围。企业应建立AI资产清单,对所有引入的模型、数据集和API服务做安全评估,并在API网关层实施速率限制、内容过滤和异常检测。对于需要访问内部数据的代理,应采用最小数据集原则,只暴露完成任务所需的最少字段,而不是将整个数据库向模型敞开。这一层的平衡很微妙:限制过严会扼杀AI的价值,过于宽松则可能引发数据泄露。
最后,所有代理决策都必须留下可追溯的证据链。当代理自主关闭服务器、调整防火墙规则或批准转账时,安全团队要能回答“它为什么这么做”以及“谁授权了它”。这意味着审计日志需要记录触发决策的输入数据、模型推理的关键参数、调用的外部工具以及输出结果与时间戳,并且这些日志应当不可篡改、支持事后回放。更进一步的做法是引入实时行为看板,让管理员能随时查看活跃代理的决策树与风险评分,而不是等事故发生后再翻查日志。
从身份到行为,从调用到审计,这四个层面构成的是一个闭环:身份可信解决“谁在操作”,行为可信判断“操作是否正常”,调用可信保障“依赖的资源是否安全”,结果可审计则为所有操作留下证据。对安全团队而言,这套框架不是一次性项目,而是需要随代理渗透率提升而持续迭代的治理能力。建立行为基线的本质,是把信任从静态位置迁移到动态行为上——只有持续验证,才敢把关键业务交给代理执行。