返回资讯列表
通过动态语义路由校准缓解LLM过度拒答问题

通过动态语义路由校准缓解LLM过度拒答问题

2026年9月23日作者:AI铺子编辑部
大模型学术

一项新研究从注意力机制层面解释了大模型过度拒绝的成因。研究指出,少数超敏安全头会在涉及安全话题的无害提示上误触发,引发路由冲突并绑死拒绝语义;为此提出无需训练的语义路由校准框架,在推理时抑制问题安全头并融合双分支 logits。

arXiv:2609.25049v1 公告类型:新提交 摘要:经安全对齐的大型语言模型(LLM)常存在过度拒绝(over-refusal)问题,即错误地拒绝无害但涉及安全话题的指令。以往研究主要将其归因于静态的表征重叠,却在很大程度上忽视了其背后的动态机制。本文从 Transformer 注意力内部路由冲突的视角,对过度拒绝进行了机制层面的分析。我们发现,一个稀疏的"超敏安全头"(Hypersensitive Safety Heads)子集会在 Hard-Safe 提示上误触发,表现出异常的注意力纠缠,强行将无害的目标实体与拒绝语义绑定在一起。这会引发严重的高熵路由冲突,使目标实体无法获得必要的注意力。为抵消这一现象,我们提出了语义路由校准(Semantic Routing Calibration, SRC),这是一个轻量级、无需训练(training-free)的推理框架。SRC 能在推理阶段精确定位并动态抑制这些超敏安全头;同时配合双分支 logits 融合,在后续解码过程中充当安全正则器,从而无缝恢复可信的推理能力。大量实验表明,SRC 能够缓解过度拒绝,同时尽可能保持模型内在的安全性能。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明