返回资讯列表

动态语义路由校准缓解 LLM 过度拒答问题
2026年9月23日作者:AI铺子编辑部
大模型学术
一项新研究从注意力路由冲突角度解释大模型过度拒答的成因,并提出免训练干预方案。核心发现是稀疏超敏安全头会在无害提示上误触发,把目标实体与拒绝语义强行绑定。SRC 可在推理时定位并抑制这些头部,融合双分支 logits 以恢复正常解码。
arXiv:2609.25049v1 公告类型:新提交
摘要:经过安全对齐的大型语言模型(LLM)常存在过度拒绝(over-refusal)问题,即错误地拒绝无害但涉及安全话题的指令。以往研究主要将其归因于静态的表征重叠,却在很大程度上忽视了其背后的动态机制。本文从 transformer 注意力内部路由冲突的视角,对过度拒绝进行机制性分析。我们发现,一个稀疏的"超敏安全头"(Hypersensitive Safety Heads)子集会在 Hard-Safe 提示上误触发,表现出异常的注意力纠缠,强行将无害的目标实体与拒绝语义绑定在一起。这会引发严重的高熵路由冲突,使目标实体无法获得必要的注意力。为对抗这一现象,我们提出语义路由校准(Semantic Routing Calibration, SRC),这是一个轻量级、免训练的推理框架。SRC 能在推理阶段精确定位并动态抑制这些超敏安全头;并结合双分支 logits 融合,在后续解码过程中充当安全正则化器,从而无缝恢复可信的推理。大量实验表明,SRC 能缓解过度拒绝,同时尽可能保留内在的安全性能。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。