返回资讯列表
EvoFlint:多轮 LLM 漏洞的进化图谱

图源:arXiv cs.CL

EvoFlint:多轮 LLM 漏洞的进化图谱

2026年9月2日作者:AI铺子编辑部
大模型融资

00487v1 公告类型:new 摘要:前沿语言模型通常会拒绝有害的单轮提示,但当同样的意图通过多轮对话逐步达成时却往往选择服从,这使得多轮攻击成为大语言模型最不为人所知的失效模式之一

arXiv:2609.00487v1 公告类型:new

摘要:前沿语言模型通常会拒绝有害的单轮提示,但当同样的意图通过多轮对话逐步达成时却往往选择服从,这使得多轮攻击成为大语言模型最不为人所知的失效模式之一。大多数自动化红队测试方法将此视为生成问题:产出能够攻破模型的攻击。而我们认为,将其界定为搜索问题更为恰当:发现、组织并迭代优化多样化的攻击策略档案,生成一张目标模型失效方式的结构化图谱,而非零散的成功案例列表。我们提出 EvoFlint,将进化质量多样性搜索应用于多轮红队测试。攻击策略是分阶段的对话计划,而非原始提示,并通过 LLM 驱动的变异和交叉操作进行进化。基于攻击成功率与峰值严重度的 Pareto 适应度保留了来自"差一点成功"攻击的选择信号。风险索引档案在每个单元格内基于策略描述嵌入进行局部竞争的 novelty search,无需预设风格分类体系即可维持多样性。生成级记忆在种群中累积对目标模型的洞察,并反馈至策略生成环节。在 HarmBench-test 划分上,EvoFlint 对 Claude Sonnet 4.6 达到 35.8% 的攻击成功率,对 GPT-5.4 达到 59.7%,对 Qwen3-32B 达到 94.3%,同时作为基线参考的旧版 GPT-4o 达到 98.7%。最终按风险类别组织的档案揭示了每个目标模型的安全训练已覆盖和尚未覆盖的危害类别。

来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明