谷歌研究人员提出RRSI新方法,可抑制自改进AI智能体对测试任务的记忆化,在未见基准上最高提升4.7分。

该AI智能体训练方法比未正则化版本减少约30%的token消耗。自改进智能体常因记住测试任务导致新任务增益消失,RRSI通过正则化缓解此问题。

RRSI在未见基准上提升4.7分且token消耗减少30%,表明大模型智能体泛化能力与推理效率可同步优化。

来源:权威科技媒体