返回资讯列表
AIBuildAI-2.5:基于LLM树搜索的自主模型开发框架

AIBuildAI-2.5:基于LLM树搜索的自主模型开发框架

2026年9月23日作者:AI铺子编辑部
大模型

AIBuildAI-2.5 是面向自主模型构建的新型 Agentic 系统,围绕效率瓶颈给出三项改进。其以评判器与选择器协同的 LLM 引导树搜索替代依赖少量含噪奖励的传统排序;调度器结合硬件资源启动训练。

arXiv:2609.25047v1 公告类型:新发布 摘要:能够自动构建人工智能(AI)模型的自主 Agent,有望拓宽 AI 在科学与工程领域的普及范围。此类 Agent 中一个热门技术路线将模型构建转化为代码搜索问题,并通过树搜索求解——树中每个节点代表一个候选程序,通过从父节点生成子程序来扩展搜索树。目前这类 Agent 在贴近现实的 benchmark 上已接近资深 AI 工程师的水平。然而,这些 Agent 在效率方面仍存在三个尚未被充分解决的短板。其一,在现实的资源预算内只能执行少量候选方案,因此依赖已执行奖励对节点进行排序的搜索规则(如蒙特卡洛式树搜索)只能依据少量且含噪的得分,导致对下一个待探索节点的选择效率不高。其二,缺乏资源感知的训练任务调度策略,可能降低硬件利用率和训练效率。其三,每次 Agent 调用均由单一的大模型提供服务,推高了推理成本。在此,我们推出 AIBuildAI-2.5——一个由 LLM Agent 执行树搜索的 Agentic 系统,针对上述三个问题逐一给出解决方案。AIBuildAI-2.5 提出了一种新颖的 LLM 引导树搜索:由评判器(judge)从预期改进、依据充分性和可行性三个维度对每个候选方案打分,再由选择器(selector)结合这些得分与搜索状态对候选池进行排序。此外,AIBuildAI-2.5 还包含一个调度器,在启动训练任务时充分考虑当前硬件资源状况;以及一个路由器(router),将成本更低的 LLM 分配给要求较低的任务,同时为 AI 模型构建工作流中最具挑战性的子任务保留能力最强的 LLM。AIBuildAI-2.5 在 MLE-Bench 上以 73.3% 的奖牌率排名第一,并在 AIRS-Bench 的六个自主 AI 研究任务上超越了一个强基线。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明