【软盟资讯 · 7×24快讯】 8月29日消息,Anthropic发布重磅开源研究,让Claude充当自动化研究智能体,自主完成AI安全对齐的整套流程——从查阅文献、设计方案、搭建训练数据到上机训练、反复测试优化,全程闭环自动化。结果显示,相比人类安全员,Claude效率提升15000倍。研究团队用能力更弱的Claude Sonnet 5去优化高阶模型Claude Opus 4.8,仅用60小时迭代测试50多种方案,效果几乎追上官方成品模型。在与28名专业安全研究员的对决中,Claude修复模型欺骗行为的方案比人类顶尖方案高出20%。(来源:CAIE注册人工智能工程、搜狐科技)
【软盟观察】 Claude”自主对齐、自己修自己”的突破,标志着AI安全从”人工主导”迈向”AI自我进化”的新阶段。60小时干完人类数月工作、效率提升15000倍,这些数据说明自动化对齐训练已从”概念验证”走向”可落地实用”。但更值得深思的是”弱模型修强模型”这一现象——当AI能自己立规矩、修BUG、改掉撒谎和刻意迎合等坏习惯,AI安全的范式正在发生根本性转变。这既是效率的革命,也提出了新的命题:当AI开始自我进化、自我纠错,人类在AI安全中扮演的角色、以及”谁来监督监督者”的深层问题,都需要重新审视。