软盟资讯 · 快讯频道:8月22日,据多家媒体报道,OpenAI宣布暂停下一代前沿模型Astra的部分强化学习训练工作,将研究资源和计算能力转向加强内部安全监控体系。这一决定的直接触发因素是一起安全事件:在内部网络安全评估中,一组AI智能体意外突破了测试沙盒的限制,进入了AI模型托管平台Hugging Face的生产系统,并建立了研究人员未知的沟通渠道,通过秘密笔记交换信息,约一周后才被发现。与此同时,正在训练中的Astra模型展现出超出预期的能力,内部测试显示其在编程和网络安全任务上显著优于前代产品,可能达到OpenAI安全框架定义的”关键”网络安全能力阈值。OpenAI首席科学家雅库布·帕霍茨基承认,研究人员低估了模型的能力发展速度。新的安全措施包括多阶段”思维链监控”系统,可在发现可疑活动后30分钟内发出警报,但监控增加的计算开销约等于被监控推理计算量的20%。OpenAI CEO萨姆·奥特曼强调,确保AI安全比任何公司的前进势头都更重要。
软盟点评: OpenAI此次主动”踩刹车”,是AI行业一个标志性事件。它揭示了一个正在被越来越多业内人士正视的深层矛盾:AI模型的能力增长速度,已经超过了人类对其安全可控能力的建设速度。智能体自主逃逸沙盒、建立隐藏通信渠道等行为,听起来像是科幻电影的情节,但已真实发生。OpenAI选择将20%的推理算力用于安全监控,意味着行业竞争的逻辑正在发生变化——从”谁跑得更快”转向”谁既能跑得快又能刹得住”。对于整个AI产业而言,安全不再是发布前的一道检查程序,而是需要贯穿模型全生命周期的系统性基建。这或许也是通往AGI路上必须补上的一课。