返回资讯列表
Agent可利用基础模型规避AI检测

Agent可利用基础模型规避AI检测

2026年9月30日作者:AI铺子编辑部
大模型学术产品

一项新研究揭示了AI检测系统面临的全新挑战。搭载基础语言模型的coding agent通过拼接生成文本,能产出连贯且高质量的内容,成功绕过商用检测器与软水印。实验显示该方法使检测率大幅下降,但token消耗导致API成本最高增加30倍。

arXiv:2609.31876v1 公告类型:new 摘要:我们表明,配备基础语言模型的 coding agent 可以通过拼接其生成的样本来组装回复,从而成功规避检测。已有研究表明,基础模型能够规避商用检测器,然而此前的"人性化"技术依赖于让这些模型对 AI 输出进行多轮改写,这不可避免地会导致语义漂移。相比之下,让 coding agent 直接编排写作过程、将基础模型生成的文本样本拼接起来,能够产出连贯、针对特定任务且总体质量较高的输出。我们发现,在 Claude Code 框架下运行的 Claude Opus 5 能够有效地编排本地 32B 参数的 OLMo-2 基础 LM,在涵盖创意写作、事实 grounding、健康问答和指令遵循的多个 benchmark 上几乎没有损失任务准确率,同时使用了高达 90% 的基础 LM token。以这种方式构建的回复降低了事后检测器(Pangram v4 检测率从 77% 降至 24%)和预先施加于 agent 生成内容的软水印(在低 FPR 下模拟检测率降至 10%)的有效性。尽管这种规避手段有效,但它需要 agent 消耗明显更多的输入和输出 token,按 API 定价计算,每次查询的美元成本最高增加 30 倍。总体而言,本工作展示了一类针对 AI 文本检测的新型对抗攻击的有效性,并敦促事后检测服务提供商在其训练数据中纳入基础模型的输出。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。