返回资讯列表
Mr.LHDR:多模态真实场景长周期深度研究 Agent 基准
2026年9月12日作者:AI铺子编辑部
学术
11318v1 公告类型:new 摘要:深度研究 Agent 在网页搜索、工具调用、多模态证据分析与信息综合方面的能力日益增强
arXiv:2609.11318v1 公告类型:new
摘要:深度研究 Agent 在网页搜索、工具调用、多模态证据分析与信息综合方面的能力日益增强。然而,现有 benchmark 主要评估中等时程的探索能力,很少检验 Agent 能否维持长时间、强依赖的研究过程。我们提出 Mr.LHDR(Multimodal real-world Long-Horizon Deep Research),这是一个用于评估真实世界深度研究的 benchmark,涵盖八个类别,关注冗长且不可约的相互依赖证据链。每道题目都基于隐藏的 Node-Relation 图构建,平均需要 12.1 个必要的中间结论,平均依赖深度为 10.4,最终得到一个简短、唯一且可验证的答案。题目包含多模态证据,包括图像、地图、PDF、logo、图表、表格和视频帧,其中至少有一个非文本元素会改变推理状态。Mr.LHDR 同时评估最终答案以及标注依赖关系下中间结论的正确性。我们使用 Overall Accuracy(OA)、Strict Accuracy(SA)、Checklist Score(CS)和 Dependency-Aware Checklist Score(DACS)来评估通用模型、深度研究系统和 Agent 框架。结果显示,即使是最强的系统也仅达到 43.1% 的 OA 和 34.3% 的 SA,表明最终答案的准确率会显著高估完整研究的成功率。移除图像会使 DACS 下降 12.6 个百分点,体现了多模态证据的重要性;同时,随着推理链变长,SA 持续下降。这些发现揭示,对当前深度研究 Agent 而言,关键瓶颈在于持续且依赖一致地整合证据,而非孤立的事实检索。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。