返回资讯列表

图源:arXiv cs.CL
INSPIRE:内化-改进式范例驱动数学推理新框架
2026年8月31日作者:AI铺子编辑部
行业动态
27501v1 Announce Type: new Abstract: 大型语言模型(LLMs)在数学推理方面进展迅速,但现有方法主要优化最终答案的正确性,这引发了一个问题:模型是否真正内化了数学概念,还是仅仅 memorized 了解题模式
arXiv:2608.27501v1 Announce Type: new
Abstract: 大型语言模型(LLMs)在数学推理方面进展迅速,但现有方法主要优化最终答案的正确性,这引发了一个问题:模型是否真正内化了数学概念,还是仅仅 memorized 了解题模式。在人类数学教育中,基于示例的推理(如构造反例来检验定理边界)反映了深刻的概念理解,但在当前 LLMs 中仍未得到充分发展。通过偏好优化来增强这一能力面临两个关键挑战:(1)模型基于示例的推理能力有限,使得构建有效的偏好对 inherently 困难;(2)能力获取是渐进式的,模型必须先学会采用这种策略,然后才能学会正确应用它。因此,我们提出了 INSPIRE,一种"先内化、再提升"(Internalize-Then-Improve)的方法,结合了 Reference-Guided Student Internalization(RGSI)——它在策略模型自身的分布下生成高质量的偏好候选——以及一种分阶段评分偏好训练策略,将学习分解为方法导向和正确性导向两个阶段。在多个模型规模和产品系列上的实验表明了一致的提升,甚至超过了更大的开源模型,而在分布外 benchmark 上的评估确认了一般数学推理能力没有退化。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。