返回资讯列表

动态语义路由校准缓解LLM过度拒答问题
2026年9月23日作者:AI铺子编辑部
大模型
arXiv:2609.25049v1 公告类型:新提交 摘要:经过安全对齐的大型语言模型(LLM)常常存在过度拒绝(over-refusal)问题,即错误地拒绝那些本身无害但涉及安全话题的指令。
arXiv:2609.25049v1 公告类型:新提交
摘要:经过安全对齐的大型语言模型(LLM)常常存在过度拒绝(over-refusal)问题,即错误地拒绝那些本身无害但涉及安全话题的指令。以往研究主要将其归因于静态的表征重叠,却在很大程度上忽视了其背后的动态机制。本文从 Transformer 注意力内部路由冲突的视角,对过度拒绝进行了机制层面的分析。我们发现,一个稀疏的“超敏安全头”(Hypersensitive Safety Heads)子集会在“硬安全”(Hard-Safe)提示上误触发,表现出异常的注意力纠缠,强行将无害的目标实体与拒绝语义绑定在一起。这会引发严重的高熵路由冲突,使目标实体无法获得必要的注意力。为抵消这一现象,我们提出了语义路由校准(Semantic Routing Calibration,SRC),这是一个轻量级、无需训练(training-free)的推理框架。SRC 能在推理阶段精确定位并动态抑制这些超敏安全头;再结合在后续解码过程中充当安全正则化器的双分支 logits 融合机制,SRC 可无缝恢复可信的推理能力。大量实验表明,SRC 能够缓解过度拒绝,同时尽可能保持内在的安全性能。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。