返回资讯列表

AIBuildAI-2.5:借助 LLM 引导的树搜索实现高效自主模型开发
2026年9月23日作者:AI铺子编辑部
大模型
AIBuildAI-2.5 是一个由 LLM 智能体执行树搜索的自主模型开发系统,针对现有代码搜索类智能体的效率短板逐一改进。它让 judge 按预期改进、依据与可行性打分,再由 selector 结合搜索状态排序候选。
arXiv:2609.25047v1 公告类型:新提交
摘要:能够自动构建人工智能(AI)模型的自主智能体,有望让科学和工程领域更广泛地用上 AI。这类智能体中有一条热门技术路线,把模型构建视为代码搜索问题,并用树搜索来求解:树中每个节点是一个候选程序,通过从父节点生成子程序的方式让树不断生长。如今,这类智能体在贴近现实的 benchmark 上已接近资深 AI 工程师的水平。然而,它们在效率方面存在三个尚未被充分解决的弱点。其一,在现实的预算约束下只能执行少量候选方案,因此那些按执行后奖励对节点排序的搜索规则(如 Monte Carlo 式树搜索)只能依赖稀少且噪声很大的分数,导致选择下一个待探索节点时效果欠佳。其二,训练任务的调度没有考虑资源感知的策略,可能降低硬件利用率和训练效率。其三,每次调用智能体都由单一强大模型来服务,推高了推理成本。本文我们提出 AIBuildAI-2.5,一个由 LLM 智能体执行树搜索的智能体系统,逐一解决了上述三个问题。AIBuildAI-2.5 提出了一种新颖的 LLM 引导树搜索:由 judge 根据每个候选方案的预期改进、依据(grounding)和可行性打分,再由 selector 结合这些分数与搜索状态对候选池排序。此外,AIBuildAI-2.5 还包含一个调度器,在启动训练任务时纳入当前硬件资源状态;以及一个路由器,把成本更低的 LLM 分配给要求较低的任务,同时把能力最强的 LLM 留给 AI 模型构建工作流中最具挑战性的子任务。AIBuildAI-2.5 在 MLE-Bench 上排名第一,奖牌率达 73.3%,并在 AIRS-Bench 的六项自主 AI 研究任务上优于一个强基线。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。