返回资讯列表

图源:arXiv cs.AI
MARS:面向竞赛编程的多专家LLM接力系统
2026年8月27日作者:AI铺子编辑部
大模型
23918v1 公告类型:new 摘要:大语言模型(LLM)在代码生成方面表现出色,但竞技编程暴露出一个持续存在的失效模式:现有的多智能体(multi-agent)流水线将工作分配给通用的规划者、编码者和调试者角色,并将算法技术的选择完全交由 backbone 模型自行决定
arXiv:2608.23918v1 公告类型:new
摘要:大语言模型(LLM)在代码生成方面表现出色,但竞技编程暴露出一个持续存在的失效模式:现有的多智能体(multi-agent)流水线将工作分配给通用的规划者、编码者和调试者角色,并将算法技术的选择完全交由 backbone 模型自行决定。我们提出 MARS(Multi-Agent Relay of Specialized LLMs,专业化 LLM 多智能体接力),这是一个纯提示词(prompt-only)框架,其中每个智能体都是特定主题的专家——动态规划、图论、字符串、几何等——并通过基于算法理论语料库的检索增强生成(RAG)进行 grounding。给定一个问题后,检索模块会选出一支相关的小型专家团队;一名 starter 编写初始 C++17 解决方案,随后每一轮都在沙箱中针对公开样例运行候选代码,让当前活跃的专家决定保留、修复或转交草稿,并将结构化数据包转发给下一位专家。最后通过一次 infrastructure-fixer 遍历来规范化样板代码。在 CodeContests 测试集上使用 Gemma 4 进行测试,MARS 达到了 $0.624 \pm 0.006$ 的通过率,平均每个任务仅需 $2.3$ 个记录的流水线阶段(相比直接提示词提升 $14.4$ 个百分点),大幅缩小了与 CodeSIM($0.731$)的差距,同时 wall-clock 成本降低至后者的 $3.3$ 分之一,且每个任务的 token 消耗方差显著更小。源代码已在 GitHub 上开源:https://github.com/fckand/mars。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。