提示词注入的关键风险,不只是让智能体生成错误回答,而是诱使它把不可信内容当成任务指令,进而调用自身已获授权的工具。只要智能体能读取文件、访问网络或操作企业系统,注入就可能把“理解内容”转化为“执行动作”,使权限边界从模型的回答层扩展到真实资源。
权限边界并不等于提示词里写下的禁令。模型可能被要求忽略恶意内容,但这类要求本身仍由模型理解和遵循;如果应用只依赖提示词或业务逻辑拦截越权行为,攻击者便可能利用指令混淆,让智能体在既有授权范围内做出不符合用户意图的操作。真正决定影响范围的,是运行环境授予了什么权限、工具如何校验调用,以及策略是否在模型之外执行。
这也意味着,注入通常不能凭空创造权限,却可能滥用智能体已有的权限。智能体若只能读取当前任务所需的资料,潜在影响便受限;若同时持有共享凭据、广泛文件访问权和高权限工具,单次误判就可能产生更大后果。主智能体把任务交给子智能体、脚本或插件时,风险还会延伸到权限是否被继承、扩大,以及策略能否覆盖整个调用链。
把边界放在执行层
防护应从限制可执行动作入手,而非只要求模型识别恶意指令。运行时策略可以约束文件读取、网络访问和工具调用;低权限账户、隔离环境则能缩小策略失效后的影响范围。凭据不应因任务方便而被无差别共享,技能和插件也需要审查。监测与审计则应记录调用链,并在发现越界行为时支持阻断或隔离。
部署前,应在不含生产数据的环境中验证:注入内容能否诱发未授权访问,子智能体是否受同等策略约束,策略配置错误或监控失效时系统如何处理。还要确认日志能够还原关键操作。运行时控制能降低提示词注入造成的影响,但不能代替最小权限、独立审计和故障处置;安全边界最终取决于每个实际执行环节是否都受到约束。