返回资讯列表
审计员也会编造:LLM检测文档污染时的批量退化与自信幻觉

图源:arXiv cs.CL

审计员也会编造:LLM检测文档污染时的批量退化与自信幻觉

2026年9月10日作者:AI铺子编辑部
大模型

09696v1 公告类型:新提交 摘要:大语言模型越来越多地被提议作为文档质量的自动化审计工具,然而其作为植入错误检测器的可靠性尚未得到充分表征

arXiv:2609.09696v1 公告类型:新提交 摘要:大语言模型越来越多地被提议作为文档质量的自动化审计工具,然而其作为植入错误检测器的可靠性尚未得到充分表征。我们构建了一个包含 150 篇学术论文的污染语料库,涵盖供应链管理与医学研究领域,并植入了 450 个已知污染物,分为三种类型:印刷错误、语义反转以及荒谬的脱离上下文插入。随后,我们在三种规模递增的提示策略下——单文档、小批量和大批量——评估了 Google Gemini 3.0 Pro 从 60 篇文档中恢复一个包含 180 个污染物的答案键子集的能力。检测能力在小规模时得以保持,随后崩溃:单文档的恢复率为 50%,小批量为 60%,大批量仅为 2.8%。在大规模场景下的失效模式并非弃权,而是捏造。该模型并未报告处理不完整,而是生成自信的结论,其中包括自行发明的污染物,例如"心灵感应松鼠"和"量子动力烤面包机"等荒谬内容,这些表述模仿了植入材料的风格,却未出现在任何文档中。检测能力还因污染类型而异:荒谬插入在已完成的评估中恢复率达 75%,而语义反转和印刷错误的恢复率均仅为 50%。那些在现实场景中最可能出现的、看似合理的污染,恰恰是最常被漏检的。我们得出结论:LLM 的文档审计能力并非优雅地退化,而是欺骗性地退化,并勾勒出此类系统所需的测试框架:有界批量大小、直接内容注入,以及针对每一处报告发现与源文本的机械式核验。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明