返回资讯列表
ScopeIF:通过分级奖励建模提升大语言模型的范围感知精确指令遵循能力

ScopeIF:通过分级奖励建模提升大语言模型的范围感知精确指令遵循能力

2026年9月30日作者:AI铺子编辑部
大模型学术

研究团队提出ScopeIF训练框架,专门强化大语言模型对约束作用范围的感知能力。该框架将客观约束解耦为范围、目标与取值三维,并构建大规模指令数据集;采用分级奖励建模量化违反程度,提供稠密监督信号。实验显示优化后的中小模型可媲美前沿商业系统。

arXiv:2609.32189v1 公告类型:new 摘要:精准的指令遵循是大语言模型(LLM)的一项基础能力,要求模型输出严格满足输入指令中的客观约束。在复杂的应用场景中,这些约束往往具有不同的作用范围,仅约束响应的特定片段而非整个输出。然而,现有的优化方法在数据构建时往往忽视约束范围,并依赖逐约束的二元奖励,导致数据多样性有限、对复杂约束的监督信号稀疏。为此,我们提出 ScopeIF,一种面向范围感知精准指令遵循的新型训练框架。我们首先引入一种统一模式,将客观约束分解为三个解耦的维度:Scope(范围)、Target(目标)和 Range(取值范围)。基于该模式,我们构建了 ScopeInstruct——一个包含多样化范围感知约束的大规模指令数据集,并结合基于工具验证与分级奖励建模,量化每条约束的违反程度,为策略优化提供稠密监督。大量实验表明,ScopeIF 持续优于现有方法,在复杂的范围感知约束上表现尤为突出,同时保持了通用能力。值得注意的是,经优化的 Qwen3-4B 和 8B 模型可媲美甚至超越 Gemini-2.5-Pro 和 DeepSeek-V3.2 等强大的前沿模型,为提升范围感知指令遵循能力确立了一种有效范式。我们的代码与数据已公开于 https://github.com/thu-coai/ScopeIF。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。