企业评估人工智能模型的安全风险,不能只看准确率、生成效果或供应商声誉,关键在于判断:模型会接触什么数据、拥有多大权限、错误会影响哪些对象,以及企业能否及时发现、纠正并追责。风险评估的核心不是预测模型“是否绝对安全”,而是识别失效条件,限制影响范围。
先评估失效后果,再决定使用方式
同一个模型用于生成内部摘要,与用于信贷审核、招聘筛选、医疗辅助或核心业务自动执行,风险等级并不相同。企业应重点分析四个维度:错误发生的可能性、错误后果是否严重、影响是否可逆,以及是否存在有效的人工接管机制。
评估内容至少应覆盖事实错误、幻觉、不完整回答、敏感信息泄露、越权执行、提示注入,以及模型升级后表现变化。不能只使用公开测试结果,还要用真实业务样本和极端情境检验模型在本企业流程中的失效方式。对于涉及个人权益、资金、合同、对外承诺或生产控制的任务,应将模型定位为辅助工具,而不是默认授权其独立决策。
权限和人工复核决定风险边界
模型能够“提出建议”与能够“直接执行”是两种不同的安全状态。企业应实施分层授权:观察与建议可以开放较多能力;查询和受控执行必须限制数据范围、账号权限与操作对象;涉及对外发布、资金操作、删除数据或其他高影响行为时,应默认人工批准,并保留审计记录。
人工复核也不能只是点击确认。审核人员需要看到必要的数据来源、模型输出和潜在影响,并拥有拒绝和升级权限。企业还应记录输入、输出、模型版本、权限变化、人工修改和最终责任人,否则事故发生后很难还原决策链条。
把上线后的变化纳入评估
模型服务商更新版本、企业调整提示词、业务数据发生变化,都可能改变系统风险。运行中应持续观察错误、异常调用、敏感信息触发、人工改写、高权限操作失败等情况,并预先明确暂停自动执行、冻结权限、切换人工流程、回滚版本和保存日志的条件。
奥尔特曼关于极端人工智能风险“不可接受”的表态,不能被当作所有AI项目都应停止的结论,却提醒企业采用更严格的风险偏好:概率不确定,不等于可以忽略严重后果。真正成熟的治理,应能证明系统在什么情况下会失败、谁有权叫停,以及失败后能否快速止损。