人工智能安全协作正在进入一个更复杂的阶段:头部模型企业既是共同风险的承担者,也是直接竞争者。据9月15日至16日公开报道,OpenAI正与Anthropic、谷歌DeepMind就人工智能安全议题接触数周,但目前尚不能据此认定三方已经签署正式协议、建立统一标准或完成技术联合。对企业而言,这首先是治理信号,而不是安全背书。
安全协作的边界,关键在于区分“风险共治”与“竞争信息交换”。企业可以围绕风险分类、模型评测、红队测试和事故披露形成共同语言,但不应借安全之名交换价格、客户、市场策略、模型权重、训练数据等敏感信息,也不能让少数头部公司事实上决定全行业的准入条件。任何行业安排都应说明参与范围、评测方法、适用边界和外部复核机制。
企业采购和部署模型时,不能只看供应商是否参与协作。更重要的是确认安全评测由谁执行、覆盖哪些业务风险、结果能否复现,以及模型更新后原有结论是否仍然有效。对于能够访问内部数据或执行外部操作的智能体,还必须落实最小权限、人工批准、操作留痕、回滚审计和事故处置责任。模型出现错误,并不会自动免除部署企业的管理责任。
企业责任不应外包
企业应把安全透明度写入采购和合同要求,关注安全报告、版本变更通知、数据使用政策、第三方评估、漏洞响应和事故披露承诺。高风险场景还需明确停用条件、数据删除、审计配合与责任承担方式。即使行业未来形成共同评测框架,也只能作为决策依据之一,不能替代企业自身的业务测试和权限控制。
行业协作可以提高风险识别效率,却不能替代公共监管。真正有约束力的安全治理,应同时具备可验证的测试证据、清晰的合作边界、独立评估和外部监督。企业不应等待统一标准落地,而应先建立自己的评测、授权、审计和应急机制;能否说清“谁评估、谁批准、谁负责”,比参与了哪一场安全讨论更能说明其治理成熟度。