返回资讯列表
SoK:Agentic AI 时代 Jailbreaking 重思:攻击、防御与实践考量

SoK:Agentic AI 时代 Jailbreaking 重思:攻击、防御与实践考量

2026年9月14日作者:AI铺子编辑部
行业动态

12413v1 公告类型:新发布 摘要:大语言模型(LLMs)正迅速从对话式助手演进为具备推理、规划、调用工具、维持持久记忆、与其他 Agent 通信并执行多步任务的 agentic AI 系统

arXiv:2609.12413v1 公告类型:新发布 摘要:大语言模型(LLMs)正迅速从对话式助手演进为具备推理、规划、调用工具、维持持久记忆、与其他 Agent 通信并执行多步任务的 agentic AI 系统。与此同时,现代模型相比早期模型展现出显著更强的原生安全对齐能力,而许多越狱攻击与防御最初正是在那些早期模型上被研究的。这一转变提出了一个根本性问题:\textit{在现代 LLM 与 agentic AI 时代,哪些既有的越狱安全研究结论仍然成立?} 我们通过一份 Systematization of Knowledge(SoK)来回答这一问题,将越狱安全重新置于完整的 agentic 执行流程中加以审视。我们构建了覆盖用户交互、规划与推理、记忆、工具使用以及 Agent 间通信的统一攻击与防御分类体系,并提出一个安全—效用—效率评估框架,将原生有害提示安全、对抗性越狱鲁棒性与 Agent 级安全结果区分开来。我们还基于一个通用的 agentic 框架,对具有代表性的攻击与防御进行了受控实证研究。结果揭示了三个重要缺口。第一,强原生对齐并不意味着对对抗性越狱具有鲁棒性。第二,防御有效性高度依赖于模型、攻击与组件,并可能在过度拒绝、效用和延迟方面带来可观代价。第三,较低的最终响应攻击成功率可能掩盖严重的中途失陷:即使最终响应被成功过滤,规划、记忆和工具交互仍可能不安全。这些发现促使越狱防御从以响应为中心,转向跨层、具备执行感知的安全方法,在保护 Agent 状态、组件转换与外部动作的同时,兼顾实际效用与效率。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明