返回资讯列表

DeReAct:分解推理与行动,打造更可靠的 AI Agent
2026年10月5日作者:AI铺子编辑部
大模型
DeReAct 是一种模块化 Agent 架构,通过外置 Critic 与 Context Manager 两个门控策略,将动作授权与完成控制从单一策略中解耦。实验显示,该方案对能力较弱的 Brain 模型提升最明显。
arXiv:2610.02351v1 公告类型:new
摘要:基于 ReAct 的 Agent 通常依赖单一 LLM 策略来提出动作、与环境交互,并判定任务何时完成。这种耦合使得动作授权与完成控制难以独立执行,导致错误传播,且不受支持的完成声明会提前终止执行。我们提出 DeReAct,一种模块化 Agent 架构,将两个门控策略外置:Critic 在执行前验证所提议的动作,Context Manager 则重建由环境支持的 \textsc{State} 并认证任务完成。
在 GAIA 和 SWE-bench Verified 上,DeReAct 对能力较弱的 Brain 模型提升 Pass@1 最为显著:Qwen3-Coder-480B 提升 6.5--7.0 个百分点,Claude Sonnet~4.5 提升 4.2--5.2 个百分点;随着 Brain 能力增强,收益逐渐减弱。轨迹与消融分析表明,当目标失败模式足够普遍且门控策略本身足够强时,外置门控是有效的。使用 Claude Opus~4.5 时,Pass@1 与 ReAct 相当,而 DeReAct 产生了证据更完整、约束满足度更高的轨迹,表明完成控制可以用更早的终止来换取更强的 grounding。总体而言,DeReAct 能改进较弱的 Agent,同时在模型能力增强时仍保留 grounding 收益。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。