返回资讯列表

图源:arXiv cs.AI
极稀疏监督激励 LLM 推理能力
2026年9月7日作者:AI铺子编辑部
大模型
04565v1 Announce Type: new Abstract: 大语言模型通过有效的 post-training 展现出日益增强的推理能力
arXiv:2609.04565v1 Announce Type: new
Abstract: 大语言模型通过有效的 post-training 展现出日益增强的推理能力。然而,主流的 post-training 方法需要在海量 token 上进行优化,隐式假设有效的学习必须是 token 密集型的。我们在 on-policy distillation(OPD)设定下重新审视这一假设——该设定天然允许在每个生成 token 处获得密集的 teacher 监督。以 Qwen3 系列模型为研究对象,我们发现了一个反直觉的现象:推理能力可以通过极少量的生成 token 来有效激励——每条推理轨迹仅需一到两个 token,仅占总 token 量的 0.05%。令人惊讶的是,这种稀疏监督在大多数情况下能够匹配甚至超越全 token 训练对推理能力的提升效果,尽管训练目标中排除了绝大多数生成 token。这一现象在涵盖不同模型规模的九组 teacher-student 配置的数学推理任务中得到了一致观察,并进一步在代码推理、Llama 模型以及基于 Proximal Policy Optimization(PPO)的 verifiable reward 强化学习(RLVR)中得到验证。有趣的是,这种极度稀疏的监督可能更接近自然学习过程:人们并非逐字纠正每一步,而是反思少数关键推理步骤,更新先验理解,并继续试错,避免微观层面的纠正,同时保持显著的有效性。总体而言,我们的结果挑战了"有效的 post-training 必须是 token 密集型"这一假设,为理解和设计更高效的 post-training 算法指明了新方向。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。