返回资讯列表
让每次工具调用都有价值:面向 Agentic 视觉语言模型的必要工具-证据路径奖励

图源:arXiv cs.AI

让每次工具调用都有价值:面向 Agentic 视觉语言模型的必要工具-证据路径奖励

2026年9月5日作者:AI铺子编辑部
大模型

03493v1 发布类型:新论文 摘要:现代视觉-语言模型(VLMs)能够直接回答许多基于图像的问题,但在处理需要细粒度视觉细节或外部知识的复杂查询时往往力不从心

arXiv:2609.03493v1 发布类型:新论文

摘要:现代视觉-语言模型(VLMs)能够直接回答许多基于图像的问题,但在处理需要细粒度视觉细节或外部知识的复杂查询时往往力不从心。为获取缺失的证据,agentic VLMs 会调用图像裁剪、图像搜索和文本搜索等工具。然而,现有训练范式主要依据最终答案的正确性来评估工具使用,导致证据获取与利用环节缺乏充分监督。这带来了两个关键缺陷:(i)模型频繁发出冗余或偏离目标的工具调用,无法收集必要证据;(ii)即使调用了合适的工具,模型也常常未能从返回的观察结果中提取必要信息。为解决这些局限,我们提出了 NTEP(Necessary Tool-Evidence Path,必要工具-证据路径),一种新型标注方案,为每个查询明确指定必需的外部证据及对应的工具调用。在此基础上,我们提出了 NTEP-R(NTEP Reward,NTEP 奖励),一种监督机制,确保每次工具调用严格推动推理过程向最终解决方案迈进。具体而言,我们的方法奖励 agent 将其调用前意图与必要的证据搜寻目标对齐,并确保从调用后观察中总结的信息与必要证据对齐。此外,我们引入非重复目标正则化器,对重复访问已满足 NTEP 目标的冗余调用进行惩罚。在七个基于图像的 benchmark 上的广泛评估表明,我们的 8B 参数实例化模型 NTEP-8B 在统一的三工具框架内显著提升了面向搜索的准确率和工具使用效率。这些结果凸显了细粒度工具-证据路径监督对于训练鲁棒 agentic VLMs 的关键价值。

来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明