MIT Technology Review刊文指出,业界对大语言模型“拒绝回答”能力寄予过高信任,AI安全对齐策略存在认知偏差。

2021年Anthropic提出大模型应“有用、诚实且无害”,要求AI拒绝危险请求。前OpenAI安全研究员Steven Adler透露,早期模型“什么都敢说”;哈佛研究员Ryan McBain称,询问早期聊天机器人自杀方法“极易生成回答”。如今企业通过AI互训方式,让模型学会拒绝有害提示。

AI互训拒答机制虽降低了直接滥用风险,但过度依赖模型自主判断,反而可能掩盖对齐策略的深层缺陷。

来源:权威科技媒体