返回资讯列表
任务状态对 LLM Agent 的影响应有多大?

任务状态对 LLM Agent 的影响应有多大?

2026年9月23日作者:AI铺子编辑部
大模型

arXiv:2609.25686v1 公告类型:新发布 摘要:长周期指派工作要求 LLM agent 持续跟踪任务状态:哪些步骤已完成、被阻塞、已取消,或仍可重复执行。

arXiv:2609.25686v1 公告类型:新发布 摘要:长周期指派工作要求 LLM agent 持续跟踪任务状态:哪些步骤已完成、被阻塞、已取消,或仍可重复执行。现有 agent 系统要么将状态以文本形式保留在 prompt 中、依赖模型自行读取,要么将状态移入强制执行该状态的模块;而每个系统都是作为整体被评估的,因此无人知晓可靠性究竟有多少来自状态的"展示"、"告知"还是"强制"。我们固定任务规则、模型及成对 episode,仅改变任务状态触达 agent 的强度:原始对话记录、精确 checklist、由任务简报编译而来且仅由执行回执推进状态机的逐轮指令,或在该状态机之上拒绝违反状态操作的强制门控;每个 episode 均通过与动态 ground truth 的精确负载匹配来评分。在三个模型、两种推理模式和两个领域中,在不启用逐轮推理的情况下,四项发现始终成立:展示精确状态并不可靠;agent 自行编写的未经验证台账优于展示给它的精确 checklist;指令的增益与模型的服从度成正比;强制门控不依赖服从性,但受制于其状态的正确性以及将请求映射到步骤的匹配器;在 235B agent 上启用逐轮推理会压缩这些差距,却无法修复文本层级的问题。同一个由 $\tau^2$-bench 航空政策编译而来的门控,将 235B agent 的 pass$^1$ 从 0.39 提升至 0.54,而对极少违反政策的 35B agent 则毫无影响;在 PM-Bench 上,行动取决于识别线索而非状态,此时展示记录是最佳层级——匹配或超越两种门控方案,并逆转了台账优于 checklist 的结论;若强制执行匹配器的判断,反而使 35B agent 的表现低于原始对话记录。当失败可由状态判定且频繁发生时,强制门控带来收益;当门控判断错误时,强制门控则造成损害。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明