FM-Bench:多智能体竞争场景下的长程管理基准测试
18423v1 发布类型:新论文 摘要:语言模型智能体如今已能可靠执行有边界的任务
arXiv:2608.18423v1 发布类型:新论文
摘要:语言模型智能体如今已能可靠执行有边界的任务。但在长周期场景中——行动具有累积效应,且环境会对其选择做出响应——它们能否维持有效决策,很大程度上仍缺乏衡量。FM-Bench(Football Management Benchmark,足球管理基准)正是为此而设。一个 LLM 智能体通过 26 个工具、约 340 至 400 个决策节点,运营一家足球俱乐部长达 20 个游戏内年份。它以与各对手相同的预算组建阵容、交易球员、谈判合同、投资设施与青训、排布首发阵容,并向可能解雇它的董事会负责;同时,一个确定性引擎将每一年的结果累加为最终得分,全程无需 LLM 评判或人工评分。单人赛道让 15 个前沿模型各自对阵一个固定的脚本化世界;竞技场则将同等模型与一个脚本化锚定对手置于同一个共享的 20 年世界中——据我们所知,这是首个如此规模的头对头评估。我们测算了得分背后的六项行为能力。跨三个种子,全部 15 个模型完成了完整周期,而盲脚本化基线在大多数周期中消亡;claude-fable-5 在单人赛道平均分与竞技场中均居榜首,但冠军头衔仍在十个模型间轮转。规模、价格或厂商均无法预测排名;排名仅在周期后期才趋于稳定,而表现最佳的人类首玩者仅列模型榜末位。区分模型的是管理行为而非计算能力。高分模型在末期减少慢回报投资、保持现金运转而非闲置、并远早于截止日前开启续约谈判,而 token 消耗则毫无预测力。没有模型能从数百次被拒报价中学会市场的隐藏价格,自管理记忆以两种相反模式失效:要么档案只增不减,要么计划每季重写。代码已开源:https://github.com/Analogy-AI/fm-bench。
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。