返回资讯列表

通过动态语义路由校准缓解 LLM 过度拒答
2026年9月23日作者:AI铺子编辑部
大模型
一项发表于 arXiv 的研究从注意力路由冲突视角揭示了大语言模型过度拒答的内在机制。团队发现稀疏超敏安全头会在无害提示上误触发,将目标实体与拒绝语义强行绑定;为此提出免训练的语义路由校准框架,动态抑制问题头并融合双分支 logits。
arXiv:2609.25049v1 公告类型:新发布
摘要:经过安全对齐的大型语言模型(LLM)常存在"过度拒绝"(over-refusal)问题,即错误地拒绝那些虽涉及安全话题但本身无害的指令。以往研究主要将其归因于静态的表征重叠,却在很大程度上忽视了其背后的动态机制。本文从 Transformer 注意力内部路由冲突(routing conflict)的视角,对过度拒绝进行机制性分析。我们发现,一个稀疏的"超敏安全头"(Hypersensitive Safety Heads)子集会在 Hard-Safe 提示上误触发,表现出异常的注意力纠缠,强行将无害的目标实体与拒绝语义绑定在一起。这会引发严重的高熵路由冲突,使目标实体无法获得必要的注意力。为对抗这一现象,我们提出了语义路由校准(Semantic Routing Calibration, SRC),这是一个轻量级、免训练的推理框架。SRC 能在推理阶段精准定位并动态抑制这些超敏安全头,并结合双分支 logits 融合,在后续解码过程中充当安全正则化器,从而无缝恢复可信的推理能力。大量实验表明,SRC 能缓解过度拒绝,同时尽可能保持内在的安全性能。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。