返回资讯列表

图源:arXiv cs.AI
记忆何时有用?面向工具调用 LLM Agent 长期记忆的成本感知评估
2026年9月9日作者:AI铺子编辑部
大模型
05441v1 公告类型:新发布 摘要:当前对 LLM Agent 长期记忆的评估,主要依赖对话回忆类 benchmark(如 LoCoMo、LongMemEval),它们衡量的是基于对话历史进行问答的能力,而非被记住的事实是否会改变一个会使用工具的 Agent 的行为
arXiv:2609.05441v1 公告类型:新发布
摘要:当前对 LLM Agent 长期记忆的评估,主要依赖对话回忆类 benchmark(如 LoCoMo、LongMemEval),它们衡量的是基于对话历史进行问答的能力,而非被记住的事实是否会改变一个会使用工具的 Agent 的行为。我们提出 MERIT(Memory Evaluation for Realistic Instrumented Tasks),这是一个用于在显式成本核算下,衡量记忆对任务执行 Agent 边际效用的 benchmark 与测试框架。MERIT 提供三个领域的 episodic 工具使用任务,其对先前 episode 事实的依赖经过自动化泄漏检查验证;包含以更新事实回忆为终点的难度阶梯;可控的记忆损坏机制;并对每一次记忆操作进行完整的 token 与美元计量。在 23,440 个计分 episode(花费 42.57 美元)中,我们首先在 gpt-4.1-mini 上进行了两代模型的试点实验,随后又开展了预注册的 3 模型 × 3 随机种子网格实验(GPT-4.1、Claude Haiku 4.5;记忆侧保持不变)。结果显示,记忆将有依赖关系的任务成功率从经泄漏验证的 0.00 下限提升至 0.55-1.00。在更新事实方面,embedding 检索会不可预测地崩溃(跨模型为 0.30-0.95;最大种子间差距达 0.45),Agent 即使正确检索到数值,也仅有 55% 的概率据此行动;而写入时更新(update-on-write)的存储方式(包括结构化事实存储,以及尤为值得注意的 LLM 总结)则保持在 0.70-1.00;混合方案的表现反而不如单独使用事实存储。针对最新一代模型的抽查验证(Claude Sonnet 5,以干净的全量重放对照组为前提)复现了这一规律。更换记忆的实现方案可使任务成功率变动高达 60 个百分点,而全量重放从来都不经济:每个领域中表现最佳的条件,其每美元边际效用达到全量重放的 2.7-3.9 倍。我们已开放该 benchmark、测试框架及全部运行轨迹。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。