模型可解释性
-
从“递归自我改进”到现实风险:OpenAI警告究竟在担心什么
OpenAI首席科学家警告人工智能发展速度过快,呼吁在安全问题未解决前保持极度谨慎。文章厘清“递归自我改进”的真实含义,指出模型参与研发不等于自主升级,并分析能力增长与安全验证之间的不对称,以及监控难度增加的多重原因。
-
思维链监控为什么可能失效:Astra争议背后的模型可解释性挑战
Astra争议将模型可解释性难题推向焦点:循环深度让更多推理发生在潜空间,文字思维链可能无法完整反映决策过程。文章分析监控失效的前提与风险边界,提出结合输出、工具调用、权限和行为轨迹的多层安全评估,并强调公开证据不足以证明模型已失控。