返回资讯列表
MARS:面向竞赛编程的多专家 LLM 接力系统

MARS:面向竞赛编程的多专家 LLM 接力系统

2026年8月27日作者:AI铺子编辑部
大模型

23918v1 发布类型:新论文 摘要:Large Language Model 在代码生成方面表现出色,但 competitive programming 暴露出一个持续的失效模式:现有的 multi-agent pipeline 将工作分配给通用的 planner、coder 和 debu...

arXiv:2608.23918v1 发布类型:新论文

摘要:Large Language Model 在代码生成方面表现出色,但 competitive programming 暴露出一个持续的失效模式:现有的 multi-agent pipeline 将工作分配给通用的 planner、coder 和 debugger 角色,并将算法技术的选择完全委托给 backbone model。我们提出 MARS(Multi-Agent Relay of Specialized LLMs),一个纯 prompt 框架,其中每个 agent 都是特定主题的专家——dynamic programming、graphs、strings、geometry 等——并通过 retrieval-augmented generation 基于算法理论语料库进行 grounding。给定一个问题后,retrieval 会选出一支相关的专家团队;一名 starter 编写初始的 C++17 解决方案,随后每一轮都在 sandbox 中针对 public examples 运行候选代码,让当前活跃的专家保留、修复或移交草稿,并将结构化数据包转发给下一位专家。最后通过一次 infrastructure-fixer pass 统一规范化 boilerplate。在 CodeContests 测试集上使用 Gemma 4,MARS 达到 $0.624 \pm 0.006$ 的 pass rate,平均每个任务经历 $2.3$ 个记录的 pipeline stage(比直接 prompting 提升 $+14.4$ 个百分点),大幅缩小了与 CodeSIM($0.731$)的差距,同时 wall-clock cost 降低为后者的 $3.3$ 分之一,且每个任务的 token 消耗 variance 显著更小。源代码已发布于 GitHub:https://github.com/fckand/mars

来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明