返回资讯列表
ReLiveGym:通过回放现实数周来评估长时运行 Agent

ReLiveGym:通过回放现实数周来评估长时运行 Agent

2026年10月2日作者:AI铺子编辑部
学术

ReLiveGym 是面向长生命周期 Agent 的诊断式评估环境,通过按时间回放真实世界新闻、市场与社交媒体流,模拟数周连续运行。现有长周期研究多假设环境静态,而该环境覆盖时间敏感、推理强度与周期性等多层次任务。

arXiv:2610.00710v1 公告类型:new 摘要:随着大语言模型(LLM)Agent 被广泛采用,它们越来越多地被部署到需要持续监控或周期性执行的任务中(例如市场分析)。这类 Agent 需要能够在无人值守的情况下连续运行数天乃至数周,在恰当的时机采取行动,并随时间推移适应动态变化的环境。现有的长周期(long-horizon)Agent 研究并未充分覆盖这些挑战,因为它们通常假设环境是静态的、不随时间变化。我们提出 ReLiveGym,一个面向长生命周期任务的诊断式评估环境:在该环境中,Agent 基于按时间顺序回放的真实世界新闻、市场和社交媒体流,在模拟的数周时间里稀疏地执行动作。任务在时间敏感度、推理强度和周期性上涵盖不同层次。我们基于八个基座语言模型,考察模型选择以及 Agent 框架(harness)设计如何影响其在长生命周期任务上的表现。结果表明,Agent 如何决定“何时行动”成为长生命周期任务中一个重要的框架设计维度;并且最优设计会因任务而异,有时也因模型选择而异。我们还评估了基于事后反馈(hindsight feedback)的持续学习对性能的影响,以及它对这类长生命周期任务中已观察到失败模式的改善作用。这些发现提示,在设计长生命周期 Agent 时,模型选择、行动时机机制和反馈的使用都是重要考量因素。代码:https://github.com/SaharaLabsAI/ReLiveGym
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。