返回资讯列表

图源:arXiv cs.AI
推测性宏提交加速工具调用 Agent
2026年9月5日作者:AI铺子编辑部
行业动态
03236v1 Announce Type: new Abstract: 使用工具的 LLM agent 所消耗的 wall-clock 时间不仅用于模型推理,还消耗在串行的 action--observation 轮次中——每次工具调用、环境状态转移和观测都会延迟后续决策
arXiv:2609.03236v1 Announce Type: new
Abstract: 使用工具的 LLM agent 所消耗的 wall-clock 时间不仅用于模型推理,还消耗在串行的 action--observation 轮次中——每次工具调用、环境状态转移和观测都会延迟后续决策。我们提出 Speculative Macro Commit(SMC),一种面向双层 agent 系统的运行时机制:一个大型权威 actor 模型生成官方轨迹,而一个更快的 speculative drafter 模型则在隔离的环境快照上持续预测并执行未来的 action 链。SMC 从训练轨迹中挖掘重复出现的多 action 骨架,并将其存储在 macro 库中,用于在运行时与 drafter 预测的 action 链进行匹配。当 actor 的下一步工具调用与首个 draft action 匹配时,SMC 将剩余已预执行的 draft 步骤及其观测结果提交到官方轨迹。以 Qwen3.5-27B INT4 作为权威 actor 模型、Qwen3.5-4B 作为 speculative drafter 模型,SMC 在保持与串行 agent 相当的整体准确率的同时,在 $\tau^2$-Bench Telecom 子集上将延迟相比 Speculative Actions(SA)baseline 降低 10.23%,相比串行执行降低 18.59%。在 AppWorld 上,SMC 相比 SA baseline 减少 wall time 7.7%,相比串行执行减少 44.9%,任务完成率仅有小幅下降。总体而言,SMC 提供了一种实用的方式,可复用多步 speculative execution,将 agent 延迟降低至超越单步 speculative action 的水平。我们的代码已公开,可在 此处 获取。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。