返回资讯列表
COUNTERMEM:面向语言Agent的世界模型验证反事实记忆

COUNTERMEM:面向语言Agent的世界模型验证反事实记忆

2026年9月29日作者:AI铺子编辑部
大模型

COUNTERMEM 是一种面向语言智能体的新型强化学习框架,可在任务失败后借助世界模型评估替代行动。它将经核验的修正方案、结果与复用条件一并存入记忆,并由学习得到的策略决定何时检索或跳过。该框架在六个领域。

arXiv:2609.31874v1 公告类型:新发布 摘要:现有的 Agent 记忆框架主要通过 Agent 与事实世界的交互来创建记忆,例如记住所采取行动的反馈,以提升在未来任务中的表现。然而,这些框架在构建记忆时很少提出"假设"(what if)式的问题:如果当时采取了不同的行动,反馈是否会有所不同?这样的反馈又如何转化为有用的记忆?在活跃环境中直接获取此类反馈成本高昂,还可能改变用于对比的状态。在本研究中,我们提出 COUNTERMEM——一个用于跨任务构建和使用经验证反事实记忆的强化学习框架。在某个行动失败后,COUNTERMEM 会利用可执行的世界模型(如测试、证明检查器和求解器),从原始状态的副本或重置状态中评估局部替代方案。它将改进方案连同原始与修正后的行动、经核验的结果以及复用条件一并存储。一个学习得到的记忆使用策略会选择检索到的记录或跳过记忆,以平衡任务成功率与交互成本,而基础 LLM 保持不变。在留出(held-out)评估期间,记忆与策略均保持冻结。我们在横跨六个领域的 12 项基准设置上对 COUNTERMEM 进行了评估。使用 gpt-oss-120b 时,COUNTERMEM 在全部六个领域的 12 项基准上同时改进了 ReAct 和 Reflexion,相比未增强版本平均提升 12.6 个百分点。在横跨两个骨干模型的四领域对比中,任务运行 token 减少了 7.7-42.0%(不含离线选择器训练成本)。进一步分析表明,移除验证或持久化存储会削弱收益,而将经验证的修正应用于不合适的决策则可能适得其反。代码将于论文被接收后发布。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。