返回资讯列表

图源:arXiv cs.CL
句法与语义:Transformer 如何习得深层依赖关系
2026年8月28日作者:AI铺子编辑部
行业动态
26139v1 公告类型:新发布 摘要:大型语言模型(LLM)在句法流畅性方面表现出色,但驱动其习得深层语义依赖关系的优化动态机制仍知之甚少
arXiv:2608.26139v1 公告类型:新发布
摘要:大型语言模型(LLM)在句法流畅性方面表现出色,但驱动其习得深层语义依赖关系的优化动态机制仍知之甚少。我们提出一个机制性框架,将该学习过程建模为"表层统计"与"深层语义"之间的竞争。我们的理论分析识别出一种"梯度饥饿"(Gradient Starvation)现象:在优化早期,稀疏语义依赖关系的误差信号会受到主动抑制。这种抑制阻碍了结构性推理的学习,并导致其涌现表现为突然的相变。此外,该框架为思维链(Chain-of-Thought, CoT)策略的有效性提供了机制层面的解释。通过将中间推理步骤外化为具体 token,CoT 有效绕过了内隐推理所固有的抑制机制。我们在从 toy transformer 到生产级模型(Llama-3.1-8B、Qwen2.5-Coder-7B)的多个尺度上验证了这些发现。最后,在该理论指导下,我们提出了一种拓扑对齐的对比学习目标函数,显式修正梯度几何结构。在变量绑定任务上的实验表明,我们的方法取得的提升超过标准交叉熵微调的 2 倍。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。