返回资讯列表
教师指导反致偏差:基于奖励对齐的在线策略蒸馏研究

图源:arXiv cs.AI

教师指导反致偏差:基于奖励对齐的在线策略蒸馏研究

2026年8月31日作者:AI铺子编辑部
学术

27960v1 Announce Type: new 摘要:On-policy distillation(OPD)近期已成为大语言模型(LLM)的一种流行后训练范式,为将教师模型的知识和能力迁移到学生模型提供了高效途径

arXiv:2608.27960v1 Announce Type: new 摘要:On-policy distillation(OPD)近期已成为大语言模型(LLM)的一种流行后训练范式,为将教师模型的知识和能力迁移到学生模型提供了高效途径。然而,教师模型对学生生成前缀的指导并非总是可靠的。训练应当优化模型以生成更可能正确的回复,或者说,获得更高的 outcome reward。但在 OPD 过程中,教师模型可能提供阻碍学生向正确轨迹移动、或将学生引向错误轨迹的指导,这与 outcome reward 存在 misalignment。这种 misaligned guidance 是不可靠的,因为它会误导优化过程,最终损害模型性能。为缓解教师指导的 misalignment 问题,我们提出了 Reward-Aligned On-Policy Distillation(RA-OPD)。其核心洞见在于:仅保留那些其诱导更新能推动学生向正确轨迹移动、或阻止学生向错误轨迹移动的轨迹。具体而言,对于每条采样轨迹,RA-OPD 检查其轨迹级蒸馏回报(trajectory-level distillation return)是否与其 outcome reward 一致,然后过滤掉 misaligned 的轨迹。RA-OPD 无需额外计算开销,即可筛选出更可靠的轨迹以提升学生模型性能。我们在数学和代码 benchmark 上,使用 Qwen3 系列和 DeepSeek-R1 系列的模型对 RA-OPD 进行了评估。在七个数学 benchmark 和三个代码 benchmark 上,RA-OPD 显著优于标准 OPD 及其他测试的 OPD 变体。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明