返回资讯列表

SLCA-GRPO:解决工具调用强化学习中的跨段信用误归因问题
2026年9月25日作者:AI铺子编辑部
产品
SLCA-GRPO是针对工具调用智能体强化学习训练提出的新框架,旨在解决跨片段信用误归因问题。它先构建Schema引导的模拟器,实现无需真实API的可扩展训练;再在单组rollouts内按结构片段解耦优势估计,无需额外rollouts。
arXiv:2609.29050v1 公告类型:new
摘要:工具调用 Agent 会产生异构输出,将结构化的工具调用与用户可见的自然语言摘要交织在一起。这种输出异构性在标准 on-policy 强化学习(RL)中构成了一种结构性失效模式:像 GRPO 这样的算法会将同质的轨迹级标量优势不加区分地广播到所有 token。结果,摘要生成产生的梯度噪声会泄漏到工具决策 token 中,导致跨片段信用错误归因和脆弱的优化。在本工作中,我们提出 SLCA-GRPO,一个融入片段锁定信用分配(SLCA)的框架。为实现无需昂贵真实 API 的可扩展探索与稳定训练,我们首先构建 Schema-Guided LLM Simulator(SGLS)作为基础训练设施。在此基础上,SLCA 在单组 rollouts 内的结构片段层面解耦优势估计,无需来自中间状态的额外 rollouts。在分层奖励(HierR)的支持下,SLCA 将执行优势路由到工具 token,将偏好优势路由到摘要 token,从而消除每次策略更新中的优势污染(占主导地位的跨片段信用错误归因通道)。在 7B 骨干模型上,SLCA-GRPO 加速了收敛,并在相同训练预算下,域内评估优于标准 GRPO、ToolPO 和 RLTR +2.53 pp,在 Berkeley Function-Calling Leaderboard(BFCL)上 +1.36 pp,在 $\tau^2$-Bench 上 +9.15 pp,以更少的工具冗余和成本实现了更高的准确率。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。