提示注入如何突破工具白名单?

话题来源: Anthropic融资20亿美元估值破600亿,智能体安全成企业部署新门槛

提示注入之所以能突破工具白名单,根源在于白名单机制本身只约束了“能调用什么”,却没有约束“怎么调用”。多数企业的安全评估把注意力放在工具清单上,认为只要智能体无法访问未授权的API,风险就可控。但提示注入攻击的路径恰恰绕开了这一层:攻击者不直接操作工具,而是通过诱导智能体,让它在合法权限内执行恶意意图。换句话说,白名单防的是“谁进来”,防不住“进来之后被指使做什么”。

一个典型的攻击链条可以拆解为三个环节。第一是注入点,攻击者将恶意指令隐藏在网页内容、邮件正文、文档或用户输入中,这些内容会被智能体读取并作为上下文的一部分。第二是改写层,智能体在理解自然语言时,无法严格区分“数据”和“指令”,恶意文本被当作任务要求解析。第三是执行层,智能体调用白名单内的工具去完成这个被污染的指令,例如读取某个内部文件、向某个地址发送邮件,或修改一条工单状态。整个过程没有触碰任何白名单之外的接口,却完成了越权动作。

这意味着,单纯依赖工具白名单的企业,实际上把安全边界建在了错误的位置。白名单解决的是“智能体不能做什么”,而提示注入利用的是“智能体被诱导去做什么”。两者之间存在一个关键空隙:权限模型是静态的,而指令解析是动态的。只要智能体具备“读取外部内容并据此行动”的能力,这个空隙就天然存在。攻击者不需要找到漏洞,只需要找到一条能被智能体信任的信息通道。

要缩小这个空隙,更有效的做法是引入“动作分级”和“内容隔离”。动作分级是指,对智能体的操作按风险程度设置不同门槛:只读查询可以自动执行,涉及数据修改、外发、删除等动作必须经过人工确认或二次校验。内容隔离则是指,将外部输入与系统指令在语义层面区分开,例如对来自网页或邮件的文本标记为“不可信数据”,并对其中包含的指令性语言做降权处理。这两者配合,即使提示注入成功污染了上下文,也难以直接触发高风险动作。

另一个常被忽视的环节是审计与回滚。即便做了分级和隔离,攻击依然可能穿透防御。此时,完整的操作日志和回滚能力就是最后的兜底。企业需要能够回答三个问题:智能体在什么时间调用了哪个工具、输入是什么、能否撤销该操作的后果。如果这三个问题答不上来,说明安全评估还没有闭环。白名单之外,必须有一层“可追溯性”作为补充,否则风险只是被推迟,而不是被消除。

回到企业选型的场景,判断一个智能体平台是否真正安全,不能只看它提供了多少工具接口,而要追问它的权限模型是否支持动作分级、是否具备内容可信度标记、是否能对每次调用给出完整审计链。融资估值、演示效果、工具数量,都不构成安全性的证据。真正决定能否上线的,是攻击路径被阻断了几层,以及最后一层失效时,系统能不能被及时停下。

发表回复

登录后才能评论