返回资讯列表
多 Harness RL 教给 Coding Agent 什么?信用分配与可迁移性研究

图源:arXiv cs.AI

多 Harness RL 教给 Coding Agent 什么?信用分配与可迁移性研究

2026年9月7日作者:AI铺子编辑部
学术

04518v1 Announce Type: new Abstract: Agent 强化学习(RL)越来越多地在完整执行 harness 上运行,而 multi-harness 方案混合了两种选择:让策略暴露于多个 harness,以及在一个相对优势组内比较它们的 reward

arXiv:2609.04518v1 Announce Type: new Abstract: Agent 强化学习(RL)越来越多地在完整执行 harness 上运行,而 multi-harness 方案混合了两种选择:让策略暴露于多个 harness,以及在一个相对优势组内比较它们的 reward。我们在仓库级代码任务中分离出第二种选择。从同一个 Qwen3-8B 监督 warm start 出发,我们回放来自 Aider、OpenHands、Qwen Code 和 SWE-agent 的相同 frozen task-harness 记录,保持相同的更新次数,在两种 group-relative policy optimization(GRPO)规则下进行比较:Within(每个 task-harness 对作为一个组)和 Cross(同一任务内混合 harness),并用密封的 SWE-bench Verified oracle 对四个 source harness 和一个未参与训练的最小 harness 上的每个 checkpoint 进行评分。评估 harness 是主导变量:在 24,000 次密封评估中,它将平均 solve rate 从 2.14% 提升到 9.27%,提升了 4.3 倍,而训练方案仅带来 1.16 倍的变化。分组规则则不是。在 held-out harness 上,Cross 减 Within 为 +0.25 个百分点,95% 置信区间 [-0.48, +1.02],每个任务尝试八次;在三个训练 seed 上汇总后为 +0.16 [-0.41, +0.72],而各个 seed 的单独估计值符号相反。每种规则自身的 seed 范围 0.42 至 0.45 个百分点,超过了它们之间的差异。两种规则都将最大增益落在同一个 source harness 上。汇总的 advantage 携带了 harness 信息:一个 out-of-fold 分类器能从 Cross 的 advantage 中恢复出生成 harness,比 shuffled-label 基线高 +4.48 个百分点,而从 Within 中则完全无法恢复;并且两种规则在每个 harness 内部仍达到相同的 held-out 分数和 action distribution。将一半训练数据重新 on-policy 收集也不会改变这一结果。Cross-harness credit 产生了配置适应,但并未带来比 within-harness credit 更强的可迁移能力。Multi-harness RL 报告应明确说明分组边界,并在未见 harness 下进行测试。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明