测试智能体的越权防护,关键不是观察它能否识别一段可疑指令,而是验证它在真实权限和工具边界内,能否拒绝不该执行的操作、限制影响,并留下足以复盘的记录。模型回答“不能做”不等于系统确实阻止了操作;测试必须检查工具调用和实际结果。
先定义边界,再设计测试
测试前应列清智能体可访问的数据、网络和工具,以及每种工具允许执行的操作。权限应按用户、任务和工具核对,尤其要确认只读能力不会意外变成写入或删除能力,任务所需的数据范围不会扩展到无关内容。边界说不清,测试结果就很难解释。
随后围绕边界构造用例:要求智能体访问无权读取的数据、调用超出任务范围的工具、把不可信内容当作操作依据,或在工具返回异常时继续执行。对发送信息、删除数据、转账或变更配置等高影响操作,还应检查人工审批是否生效,以及审批缺失或被拒绝时任务是否安全停止。测试不应只验证“正常请求能完成”,也要验证拒绝路径和失败路径。
看执行结果,不只看回答
每个用例都应记录预期权限、实际工具调用、数据是否被访问或改变、系统是否阻断,以及日志能否还原决策和执行过程。若系统只发出警告,却仍完成越权操作,就不能算有效阻断;若操作被阻止但没有可追溯记录,事后调查仍会受限。
测试可先在低风险流程中进行,再结合企业实际的权限配置、工具接口和数据边界复测。试点成功不代表生产环境安全:配置变化、工具误用或网络与工具异常,都可能改变结果。高影响操作应保留独立审批或人工确认,并在调整权限、工具或流程后重新验证。评估结论应明确覆盖范围、已知限制和未测试场景,而不是用一次演示替代持续防护。