返回资讯列表

学会跳过:面向高效多Agent LLM工作流的反事实信用分配
2026年9月28日作者:AI铺子编辑部
大模型学术
研究团队提出LW2S框架,将多智能体LLM工作流的组件省略问题形式化为反事实信用分配。该框架通过学习特定动作的安全模型,结合留出校准与领域原生守卫来选择跳过,在降低token成本的同时维持或提升聚合准确率。
arXiv:2609.30734v1 公告类型:新提交
摘要:多智能体 LLM 工作流通过规划、执行、验证与总结来提升任务表现,但每个组件的价值取决于已产生的状态。执行所有组件可能浪费计算资源,或覆盖掉正确的中间答案。我们将组件省略问题形式化为反事实信用分配:完整工作流日志揭示已执行轨迹的奖励,而受控的跳过干预则揭示省略未来步骤的后果。我们提出 Learning What to Skip(LW2S),它从这些干预中学习特定动作的安全模型,并结合留出校准与领域原生守卫来选择跳过。当早期跳过被拒绝时,控制器可以继续执行,并在后续组件上重新考虑。在数学推理、多项选择问答与代码生成任务上,基于两个指令模型家族的测试表明,LW2S 在降低记录的 token 成本的同时,在评估场景中达到或提升了聚合的全工作流准确率。规模化实验与第二种拓扑结构的实验进一步考察了组件冗余,而共享错误案例则揭示了为何仅靠一致性不足以进行跳过选择。这些发现将高效的工作流执行与学习单个组件的条件效用联系起来。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。