返回资讯列表
用 Null-Basis LoRA 对 Post-RL LLM 进行保推理微调

用 Null-Basis LoRA 对 Post-RL LLM 进行保推理微调

2026年9月23日作者:AI铺子编辑部
大模型

arXiv:2609.25618v1 公告类型:新提交 摘要:基于强化学习(RL)的后训练(post-training)已成为激发大语言模型(LLM)推理能力的有效途径。

arXiv:2609.25618v1 公告类型:新提交 摘要:基于强化学习(RL)的后训练(post-training)已成为激发大语言模型(LLM)推理能力的有效途径。然而,当需要对经过 RL 后训练的模型进行后续监督微调(SFT),以适配新的知识领域或行为时,往往会严重覆盖其已获得的推理能力。现有方法通过经验回放、专门的初始化,或基于梯度投影的约束优化来缓解这种遗忘,但要么保留效果有限,要么带来可观的训练开销。我们的分析表明,推理激活集中在低维子空间中,从而留下了大量可用于适配的零空间(null-space)容量;并且,相应的近似零空间可以仅凭少量样本可靠估计。基于这些观察,我们提出 Null-Basis Low-Rank Adaptation(NB-LoRA),一种在适配经过 RL 后训练的 LLM 的同时保留其已习得推理能力的参数高效方法。我们将推理能力保留表述为逐层隐藏状态保留约束,并基于推理激活构建固定的近似零空间基。随后,LoRA 更新通过该基进行重参数化,在整个微调过程中强制执行保留约束。在多个经 RL 训练的 LLM 及多样化下游任务上的大量实验表明,NB-LoRA 在适配性能上与标准 LoRA 相当,可将推理准确率维持在接近微调前的水平,并能将这种保留能力泛化到留出(held-out)推理 benchmark 上。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明