返回资讯列表

用 Null-Basis LoRA 对后 RL 的 LLM 进行保推理微调
2026年9月23日作者:AI铺子编辑部
大模型
arXiv:2609.25618v1 公告类型:新发布 摘要:基于强化学习(RL)的后训练已成为激发大语言模型(LLM)推理能力的有效途径。然而,当需要通过后续的有监督微调(SFT)将经过 RL 后训练的模型适配到新的知识领域或行为时,往。
arXiv:2609.25618v1 公告类型:新发布
摘要:基于强化学习(RL)的后训练已成为激发大语言模型(LLM)推理能力的有效途径。然而,当需要通过后续的有监督微调(SFT)将经过 RL 后训练的模型适配到新的知识领域或行为时,往往会严重覆盖这些已获得的推理能力。现有方法通过经验回放、专门的初始化,或使用梯度投影的约束优化来缓解此类遗忘,但要么保留效果有限,要么会带来可观的训练开销。我们的分析表明,推理激活集中于低维子空间,从而为适配留下了可观的零空间容量;并且相应的近似零空间可以仅凭少量样本可靠估计。基于这些观察,我们提出 Null-Basis Low-Rank Adaptation(NB-LoRA),一种在适配经过 RL 后训练的 LLM 的同时保留其已习得推理能力的参数高效方法。我们将推理能力保留形式化为逐层隐藏状态保留约束,并从推理激活构建固定的近似零基。随后,LoRA 更新通过该基进行重参数化,从而在微调全程强制执行保留约束。在多个经 RL 训练的 LLM 和多样化下游任务上开展的大量实验表明,NB-LoRA 在适配性能上与标准 LoRA 相当,可将推理准确率维持在接近微调前的水平,并将这种保留能力泛化到留出的推理 benchmark 上。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。