返回资讯列表
LLM后门遏制:专家隔离与关停技术

LLM后门遏制:专家隔离与关停技术

2026年10月2日作者:AI铺子编辑部
大模型学术

研究者提出名为QES的后门遏制新方法,为语言模型配置带LoRA分支的专家与路由器,训练时借辅助目标把触发行为引入隔离组件。部署阶段只需将该专家路由权重归零,即可在多数实验中把攻击成功率压至零到一成。该思路确立了学习但引流这一防御范式。

arXiv:2610.00663v1 公告类型:new 摘要:植入后门的大型语言模型(LLM)在正常输入下表现如常,但在隐藏触发器的作用下会产生攻击者指定的输出。现有防御措施分布在四个阶段——训练前、训练中、训练后和推理时——且共享两种基本策略之一:要么抑制后门学习(通过过滤被投毒的数据,或在优化过程中中断其习得),要么先学习再净化(在完全带后门的模型形成后,修复模型权重或对输入进行门控)。我们提出第三种策略:学习但引流——允许后门在训练期间形成,但将其引导至一个指定的隔离组件中,该组件可在部署时禁用。为此,我们提出隔离专家关闭(Quarantined Expert Shutdown,QES),这是一种计算高效的遏制策略,构建于正则化引导的类 MoE 场景中。具体而言,给定被投毒的数据集,QES 为基于 Transformer 的语言模型增加按路由分配的专家专用 LoRA 分支和轻量级路由器,并利用辅助路由目标,将触发条件化的行为吸引至指定专家,同时在其他部分保持正常能力。部署时,缓解措施简化为一次常数时间操作:将隔离专家的路由权重归零,无需进行触发器筛查或进一步更新模型权重。实验结果表明,在两项任务、三种攻击和四个模型家族的多数设置下,我们的方法将攻击成功率(ASR)从 100% 降至 0-10%,同时下游效用通常得以保留或仅受到轻微影响。这些结果确立了"学习但引流"作为生成式 LLM 后门遏制中一个此前未被探索的范式。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。