长期运行的 AI 智能体,真正的可控性不取决于它能否一次答对,而取决于它在持续执行、调用外部能力和遭遇异常时,是否仍被限定在可预期的边界内。只靠提示词要求“谨慎”,无法替代权限设计、过程留痕和人工接管。
首先要把权限按风险分层,而不是一次性开放全部能力。读取信息、整理内容与修改账户、对外分享,影响程度不同,应设置不同授权门槛。已有产品设计采用了清晰的区分:后台主动研究仅使用只读工具;涉及账户影响或信息分享的操作则进入审查。关键不在于某个审批形式,而在于高影响动作不能仅凭智能体自己的判断直接完成。
其次,长期运行必须有可检查的状态。系统应能说明当前目标、已完成步骤、待执行动作和调用依据,并记录关键操作;当任务偏离目标、权限不足或出现异常时,应暂停并交由人判断,而不是为了“完成任务”继续扩大行动范围。没有可追溯记录,事后难以区分是模型判断失误、权限配置过宽,还是外部环境发生变化。
还要为任务设置明确的停止条件和恢复路径。目标完成、依据不足、风险升高或任务超出授权范围,都应成为停止信号。人工批准也不能只是一次性通行证:批准某个动作,不等于授权后续所有相似动作。
因此,评估智能体是否可控,不能只看它完成了多少任务,还要检查它能否遵守最小权限、在关键动作前停下来、留下足够的审计信息,并在异常时可靠地交还控制权。长期运行的安全,最终来自系统边界,而不是对模型自律的期待。
