企业设定智能体风险准入线,关键不是问“平均表现够不够好”,而是明确:在什么业务范围、权限和监督条件下,系统可以执行哪些动作。准入线应是一组不可互相抵消的门槛;任务完成率再高,也不能抵消未经授权的敏感操作。
先按后果划分动作
评估对象应是具体任务和操作,而不是抽象的“智能体能力”。读取信息、起草建议、修改业务记录、触发不可逆操作,影响程度不同,所需控制也不同。企业可从错误影响范围、操作能否撤销、结果能否独立核验,以及是否涉及敏感数据或审批权限,判断风险等级。
风险越高,授权边界就应越窄。低影响且易恢复的步骤,可以在限定范围内自动执行;涉及资金、权限或关键记录变更的步骤,应设置明确的人工审批点。尚不能可靠核验结果,或出错后无法及时停止、撤销的任务,不宜直接获得自主执行权限。
用硬门槛决定是否准入
准入测试应在接近真实流程、但与真实数据和不可逆操作隔离的环境中进行,并预先写清验收条件。除了正常完成,还要检查任务中断后能否从正确状态恢复、失败重试是否造成重复操作、越权请求是否被拦截,以及日志能否还原关键决策和状态变化。
判定时宜区分“可优化项”和“一票否决项”。一般效率或复核成本可以作为比较指标;未经授权执行敏感操作、产生无法控制的副作用、结果无法追溯,则应作为硬性准入条件。不能用其他项目的高分将其平均掉。
准入结论还必须绑定场景、权限配置和系统版本,而不能写成对某个产品的笼统背书。上线后若任务范围、工具权限或流程发生变化,应重新评估;运行中出现异常,也要保留暂停和人工接管的路径。真正可用的风险线,不是宣称系统“足够安全”,而是明确它可以做什么、必须停在哪里,以及谁能验证并承担后续处置。
