返回资讯列表
AgentJudgeBench:评估 LLM Judge 在 Agent 工具调用能力的多难度基准测试

图源:arXiv cs.AI

AgentJudgeBench:评估 LLM Judge 在 Agent 工具调用能力的多难度基准测试

2026年8月28日作者:AI铺子编辑部
大模型

26623v1 Announce Type: new Abstract: LLM judge 已被广泛用于评估 agentic tool-calling 系统,但其在结构化、依赖驱动的工作流上的可靠性仍未得到充分检验

arXiv:2608.26623v1 Announce Type: new Abstract: LLM judge 已被广泛用于评估 agentic tool-calling 系统,但其在结构化、依赖驱动的工作流上的可靠性仍未得到充分检验。我们提出 AgentJudgeBench,这是首个系统性研究 LLM-as-a-judge 在 workflow DAG 上的 agentic tool-calling 可靠性的 benchmark,区别于 LLM-as-a-judge 在开放式文本或偏好评估等更广泛任务中的应用。该 benchmark 包含 3,808 个实例,涵盖六种 DAG 拓扑结构和三个难度层级,使用五个 generator(3B-70B 开源权重模型及 GPT-5.4)和六个 judge(20B 至 frontier 规模)在配对的有/无 ground-truth 条件下进行评估。Judge 对齐度随任务难度单调下降,无 ground truth 时下降速度快 1.5 倍;在无 ground truth 的困难查询上,六个 judge 无论规模如何均收敛于 77-82% 的狭窄区间,揭示出主要由任务难度驱动的结构性天花板,尽管其高度对部分较弱的 generator 而言部分取决于 prompt;模型容量本身无法突破这一限制。Ground-truth 暴露并非 uniformly 有益:它降低了 GPT-5.4(1.5 pp)和 Gemini-2.5-Pro(3.9 pp)的对齐度,与过度锚定效应一致。在缓解策略中,chain-of-thought reasoning 和 judge temperature 均效果甚微,而结构化评估 rubric 可将对齐度提升最多 6.5 pp,但无法在不同 judge-generator 组合间均匀泛化。在有 ground truth 条件下,QwQ-32B 最匹配程序化参考标准;一项人工验证研究将 GPT-OSS-120B 确定为最 human-aligned 的 judge;无 ground truth 时,frontier judge 仅在共享天花板内略有领先。这些结果揭示了当前 LLM judge 的根本局限性,并为 agentic 系统的可靠评估提供了实践指导。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明