返回资讯列表

潜变量递归LLM系统的设计原则思考
2026年9月30日作者:AI铺子编辑部
大模型学术
研究团队提出了一种名为REST的表征监督训练目标,用于优化大语言模型的潜在空间推理过程。该方法将因果性、最小性等四项属性转化为可微损失,有效解决了传统交叉熵训练导致的思维坍缩等问题。在多个基准测试中,该技术最高提升准确率7.5个百分点。
arXiv:2609.36159v1 公告类型:新发布
摘要:大语言模型可以在连续空间中进行推理,而不是依赖解码后的文本——具体方式是对自身的隐藏状态进行递归,或在这些状态之间于不同 Agent 之间传递,而训练过程中仅监督最终解码答案的交叉熵(CE),并不对思维过程施加约束。理论分析与实证分析确立并证实了仅使用 CE 训练会导致的四种失效模式,这些模式会降低正确答案的概率,例如在不同问题间坍缩相同的思维,以及保留无关信息。我们提出 REST(REpresentation-Supervised Thoughts,表征监督思维),这是一种训练目标,将有效思维表征的四个属性(因果性、最小性、可分离性和稳定性)转化为可微损失,并叠加到 CE 上。我们在单 Agent 与多 Agent 的潜在空间系统中实例化了该方法,无需改动架构,也不增加推理时的参数。在涵盖数学、科学、医学和代码生成的 7 个 benchmark 上,在相同训练数据、计算量和潜在空间预算下,REST 相比仅使用 CE 的训练,在不同 Agent 设置和模型规模下将准确率最高提升了 7.5 个百分点,并将收敛到最终答案的速度提高了 30%。此外,REST 的思维过程编码了更多实现正确答案所需的信息,对思维进行解码能更好地还原 Agent 的预期输出,从而让潜在空间通信更易于解释。项目网站:https://fard-lab.github.io/REST
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。