返回资讯列表
多模态 LLM 先读图还是先读文?诊断语境谄媚现象

图源:arXiv cs.CL

多模态 LLM 先读图还是先读文?诊断语境谄媚现象

2026年9月2日作者:AI铺子编辑部
大模型

00067v1 Announce Type: new Abstract: 外部文本可以覆盖多模态大型语言模型中相互矛盾的图像证据,我们将这种失效称为多模态情境谄媚(multimodal contextual sycophancy)

arXiv:2609.00067v1 Announce Type: new Abstract: 外部文本可以覆盖多模态大型语言模型中相互矛盾的图像证据,我们将这种失效称为多模态情境谄媚(multimodal contextual sycophancy)。我们引入了一个包含 998 个案例的诊断工具,独立地变化视觉证据、常识先验和外部文本,并通过移动一个情境盲视觉见证者(context-blind visual witness)周围的信息边界来探测这种失效何时发生。在异常图像与 Gemini 生成的虚假文本配对的情况下,GPT-5.1 在联合条件下的得分为 7.9%,直接对情境盲见证者报告评分时为 49.7%,在让见证者接触文本的匹配双调用见证者-仲裁者(witness-arbiter)流程中为 63.7%,而在对见证者保留文本的 System-2 Visual Arbitration(S2VA)中为 84.2%。在六个模型中,S2VA 相比直接见证者报告提升了 19.7 至 44.1 个百分点,所有配对的 95% 置信区间均不包含零。最优信息边界并非统一不变:文本情境对某些模型具有支架作用,且一个由 GPT-4o 重新生成的子集会改变联合条件、Witness-Only 和 S2VA 的相对排序。因此,情境谄媚对文本引入的时机、以及模型和情境来源均敏感。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明