长上下文如何纳入Agent安全评估?

话题来源: OpenAI 9月Agent模型:约100万token上下文、128K输出,企业接入前先核对能力边界

长上下文进入 Agent 安全评估后,评测对象就不再只是“模型能否理解一段提示词”,而是一个持续接收系统指令、历史对话、文件内容、网页内容和工具返回结果的动态决策系统。约100万 Token 的上下文窗口,最多128K Token 的输出上限,即使得到官方确认,也只能说明承载能力扩大,不能证明 Agent 会正确识别优先级、抵御恶意内容或安全执行任务。

长上下文评估的核心风险

第一类风险是关键信息被稀释。应将安全规则、权限边界和任务目标放置在不同位置,观察 Agent 是否仍能准确提取并遵守,而不是只测试关键信息出现在开头的场景。评测还要检查长文档中相互矛盾的版本、重复条款和过期内容,确认模型是否会把“出现次数更多”误判为“可信度更高”。

第二类风险是不可信内容进入上下文后改变决策。网页、代码注释、上传文件和工具返回结果都可能包含诱导性指令。安全评估应验证 Agent 能否把这些内容视为待分析数据,而不是新的控制指令;当外部内容要求泄露内部信息、绕过审批或调用额外工具时,系统应拒绝执行并保留审计记录。

第三类风险是上下文压缩或截断造成安全约束丢失。输入、历史记录、工具结果和模型输出可能共同占用窗口。超过限制后,系统可能报错、截断或自动摘要。测试必须记录压缩前后的内容,重点观察权限规则、人工确认要求、异常状态和待办事项是否被删除、改写或移到低优先级位置。

从“能记住”转向“能安全行动”

评测不应只看长文本问答准确率,还应覆盖多轮任务中的工具调用、失败恢复和人工接管。可设置长文档检索、网页访问、文件处理和分阶段执行等流程,分别观察关键事实遗漏率、工具调用错误、越权尝试、人工接管率以及恢复后的状态一致性。

高风险操作应默认采用只读、隔离、限域和人工确认。真正合格的长上下文 Agent,不是把更多内容塞进窗口,而是在信息变多、来源变杂、任务变长之后,仍能区分指令与数据,维持权限边界,并在无法判断时暂停而不是自行扩大行动范围。

发表回复

登录后才能评论