返回资讯列表
在学生状态处学习教师续写

在学生状态处学习教师续写

2026年10月1日作者:AI铺子编辑部
大模型学术产品

研究团队提出名为 OLIVE 的在线语言模型蒸馏方法。该方法让学生策略动态生成前缀,教师以自回归方式续写,学生据此计算交叉熵并更新。它克服了离线 SFT 的序列协变量偏移、在线策略蒸馏的监督信号碎片化等局限。

arXiv:2609.36246v2 公告类型:new 摘要:我们提出 OLIVE(OnLine InterVEntion)。在每次迭代中,不断演进的学生策略生成一个新的前缀,教师以自回归方式续写,学生则基于教师生成的 token 计算交叉熵并进行更新。每一项设计都针对现有蒸馏方法的相应局限:(1) 在固定教师轨迹上做离线监督微调(SFT)时存在序列协变量偏移;(2) 在 token 级在线策略蒸馏(OPD)中,一旦前缀失败,监督信号会变得碎片化;(3) 分布匹配蒸馏需要访问教师的 token 概率。OLIVE 在相近的 GPU 小时成本下,取得了比 OPD(采用 top-16 KL 近似)更高的推理性能。我们的异步实现进一步将 OLIVE 的总训练时间减少了 23.8%。我们在高难度推理任务和 agentic 任务上评估了 OLIVE,体现了现代后训练场景;在相同训练预算下,它始终优于现有蒸馏方法。通过从不断演进的学生模型重新生成前缀,OLIVE 在离线蒸馏进入平台期后仍能持续改进,同时更好地保留学生的通用能力与可塑性。仅使用 GPT-5.4-mini 的文本,持续用 OLIVE 训练在 ScienceWorld 上比使用同一教师的离线 SFT 高出 13%。这些结果支持 OLIVE 成为一种有效且高效的在线语言模型蒸馏方法。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。