返回资讯列表

轻量进化启发式方法优化 dLLM 去噪轨迹
2026年9月23日作者:AI铺子编辑部
大模型
扩散大语言模型(dLLMs)近来成为传统自回归(AR)大语言模型(LLMs)的一种颇具前景的替代方案。借助双向注意力与并行解码,dLLMs 能够实现更高效的生成。
扩散大语言模型(dLLMs)近来成为传统自回归(AR)大语言模型(LLMs)的一种颇具前景的替代方案。借助双向注意力与并行解码,dLLMs 能够实现更高效的生成。然而,它们在推理时需要精心设计的去噪调度器(训练阶段并不存在),其选择对生成质量有显著影响。尽管基于置信度的启发式调度器展现出强大的实证性能,但它们存在两种关键失效模式:EOS 溢出(EOS Overflow)与近端偏差(Proximal Bias)。通过对 Transformer 注意力模式的深入分析,我们发现这些失效源于某些位置对无效 token(如 [MASK] 和 [EOS])分配了过高的注意力权重,从而产生误导性的置信度信号。基于这一洞见,实证证据表明,有效的注意力得分可以为传统基于置信度的启发式方法提供互补指导,但没有任何单一指标能在所有场景中持续占优,这意味着最优去噪轨迹高度依赖上下文。为解决这一问题,我们提出了一种轻量级进化启发式调度器,使用协方差矩阵自适应进化策略(CMA-ES)进行优化。我们的调度器通过上下文均值场嵌入动态整合多种启发式特征,仅需 393 个可训练参数。在 LLaDA 和 Dream 上、于四个推理与规划 benchmark 的评估中,我们的方法持续优于强基线,包括传统启发式方法、块自回归方法以及近期 SOTA 方案。据我们所知,这是迄今参数效率最高的神经调度器。代码已开源:https://github.com/RS2002/Evo-Denoise 。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。