英伟达联合普林斯顿大学、马里兰大学推出PivotOPD,一种面向多轮LLM智能体的在线策略蒸馏训练方法,可让智能体规避早期关键错误并在错误发生后恢复。
在Qwen3-1.7B与Qwen3-8B学生模型上,PivotOPD在ALFWorld、WebShop及Search-based QA任务上均取得最佳平均成绩;其从72.7%重放关键错误中恢复,标准OPD仅20.3%。
PivotOPD将多轮AI智能体的错误恢复能力从20.3%提升至72.7%,且不增加推理成本,这意味着智能体在复杂任务中的鲁棒性可被系统性训练。
来源:权威科技媒体
软盟资讯 news.softunis.com 7×24小时AI快讯
