返回资讯列表
Sci-MMR:多模态Agent多步证据科学推理基准测试
2026年9月12日作者:AI铺子编辑部
行业动态
11243v1 公告类型:new 摘要:自主科研 Agent 正被寄予越来越高的期望——检索文献、分析实验证据并生成科学假设
arXiv:2609.11243v1 公告类型:new
摘要:自主科研 Agent 正被寄予越来越高的期望——检索文献、分析实验证据并生成科学假设。这些能力需要多步骤的证据锚定推理,即在得出结论之前逐步获取、整合并验证证据。然而,现有的多模态 benchmark 大多只评估最终答案的准确率,至于预测结果是否真正有可追溯的科学证据支撑,仍不得而知。我们提出 Sci-MMR——一个面向多步骤证据锚定科学推理的 benchmark,它建立在结构化的论证图之上,将科学主张、基于引文的知识、视觉证据以及支撑区域关联起来。Sci-MMR 包含 235 个多跳推理任务,覆盖四个学科,每个任务平均涉及九个图表面板。我们对八个前沿多模态模型进行了评估,发现答案准确率始终比完整证据召回率高出 20% 以上,揭示出一个仅靠答案评估在结构上无法捕捉的巨大鸿沟。通过受控干预实验,我们识别出两个根本性瓶颈。第一是证据获取:模型难以从科学图表中提取完整的结构化证据,这占失败案例的 57.2%。虽然裁剪工具带来了小幅提升(+4.5 分),但提供 gold 证据可使准确率最高提升 37.0 分,说明模型在整合跨多个区域的完整证据方面存在困难。第二是证据整合:模型难以将已有证据转化为正确结论,这占失败案例的 31.8%;即便在提供 gold 证据的情况下,最强的模型在最难任务上的准确率也仅为 69.1%。这些发现表明,当前以答案为中心的 benchmark 严重高估了多模态科研 Agent 的证据锚定推理能力。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。