返回资讯列表
自写指标:从盲点评测中进化出的评估器

自写指标:从盲点评测中进化出的评估器

2026年8月21日作者:AI铺子编辑部
行业动态

18744v1 Announce Type: new Abstract: Agent 在可靠的自动 metric 下快速提升,没有则停滞;而最需要它们的应用——报告生成是其中之一——恰恰是没人知道如何评分的领域

arXiv:2608.18744v1 Announce Type: new Abstract: Agent 在可靠的自动 metric 下快速提升,没有则停滞;而最需要它们的应用——报告生成是其中之一——恰恰是没人知道如何评分的领域。Metric 能自己写出来吗?说清什么让答案变好很难;指出答案哪里错了更容易,因此我们演化的 metric 是一个小型 Python operator 池,每个 operator 对候选答案标记一种具名缺陷,或弃权,然后投票。直接向模型索要 operator 行不通:183 个候选只实现出 96 种不同行为,全部来自巨大空间中一个狭窄区域。EvalCEGAR 转而借鉴程序验证中的 counterexample-guided abstraction refinement(CEGAR)。它将 operator 池视为一种抽象,搜索碰撞——两个被 operator 打出同分的答案,一对一错。这对答案(而非 prompt)才是撰写请求,且当碰撞击败所有尝试时,循环会扩展 operator 可读取的内容,而非重新采样。在 MBPP+ 和 HumanEval+ 上,一个由隐藏 unit tests 提供精确 ground truth 的 sandbox 中,该循环写出一个 55 行的 operator,在 428 个未见任务上,将"全不标记"与"完美过滤"之间的差距缩小了 15.4%(+0.0065, p=0.0010),标记量仅为我们最佳手写 operator 的四分之一。在它从未见过的 benchmark 上,它在三分之一的标记上与该 operator 效果完全吻合。八次运行中有六次产生此类 operator,且全部六次在 out-of-sample 上有效;我们 15 个手写 operator 合并为单一过滤层反而损失精度。基于相同信息的 LLM judge 在几乎不相交的候选集上追平了该提升,但每个候选永远消耗一次 model call,而 operator 完全不消耗。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明