返回资讯列表
有品位的 Agent:测量并提升长周期任务中的品味

有品位的 Agent:测量并提升长周期任务中的品味

2026年9月23日作者:AI铺子编辑部
行业动态

arXiv:2609.25804v1 公告类型:new 摘要:LLM Agent 越来越多地执行长程任务,而它们在执行过程中做出的决策——例如验证哪个假设,或在哪个实现基础上继续开发——决定了整个任务运行的成败。

arXiv:2609.25804v1 公告类型:new 摘要:LLM Agent 越来越多地执行长程任务,而它们在执行过程中做出的决策——例如验证哪个假设,或在哪个实现基础上继续开发——决定了整个任务运行的成败。做好这些决策正成为工程类与研究类 Agent 的关键能力。我们将 Agent 做出良好长程决策的能力称为 Agent 的品味(taste)。现有的 benchmark 衡量的是 Agent 在长程任务上的端到端成功率,但没有一个 benchmark 衡量 Agent 的品味。为解决这一问题,我们构建了 Taste-Bench——一个从 Agent 在工程与研究任务中产生的轨迹中自动构建的品味问题 benchmark。每道题目呈现一个决策岔口(decision fork),即轨迹中存在多个可选方向、且其中一个方向能带来更好结果的时间点;被评估的模型在看不到岔口之后会发生什么的情况下,在这些方向中做出选择。我们从针对同一任务的多次并行尝试中,以及从单条轨迹内部的绕路(detour)中自动挖掘这些岔口,无需人工标注。我们在 Taste-Bench 上评估了前沿模型,发现表现最好的模型也仅能答对 59.7% 的题目。我们还发现,对于所有模型而言,决定性证据出现在轨迹中较后位置的岔口要难得多;同时,增加推理预算并不能提升准确率。最后,我们证明品味是可以训练的。我们将一位能看到结果的老师模型的判断力蒸馏到学生模型中,学生模型在未见过的任务上做出了更好的决策,并在留出(held-out)的 SWE-bench Pro 任务上提升了端到端成功率。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明