返回资讯列表

Policy as Code:基于协程桥接框架提升 CAR-bench 快速推理可靠性
2026年9月25日作者:AI铺子编辑部
大模型学术政策
研究团队提出协程桥接框架,让模型直接生成可在评估器工具交互中原地阻塞恢复的 Python 程序。该设计将模型调用与工具往返解耦,使 CAR-bench 任务中位模型调用降至 2 次,同时以 60.0% Pass^3 赢得 Track 2 并达到 4.5 倍基线。
arXiv:2609.29251v1 公告类型:新发布
摘要:CAR-bench 用于评估使用工具的 Agent 在现实世界不确定性下能否保持可靠。它在评估器内部执行每个工具,使每次工具-结果交互都成为独立的 Agent 往返。传统的 next-action Agent 可以批量并行调用工具,但一连串存在依赖关系的调用会让它每处理一轮结果就消耗一次模型调用。我们提出了一种协程桥接(coroutine-bridge)框架,其中模型唯一的动作是生成一个 Python 程序,该程序能在评估器工具交互中原地阻塞并恢复。这将模型调用与工具往返解耦:在公开测试集上,该 Agent 每个任务的中位数为 2 次模型调用,而 Agent 轮次为 7 次,在 Cerebras gpt-oss-120b 上以 1.8 秒的模型延迟中位数完成完整的多轮任务。由于动作空间是可执行代码,确定性的 CAR-bench 策略直接以工具层逻辑的形式编码,而非提示词规则,从而以零推理成本强制执行合规性。在官方隐藏评估中,该框架以 60.0% 的 Pass^3 赢得 Track 2,是主办方基线的 4.5 倍,同时是所有超过该基线的参赛作品中估算成本最低、任务延迟中位数最快(3.14 秒)的方案;同一套未经修改的框架在 Open 赛道上使用 GPT-5.5 复现了完全相同的 60.0% Pass^3,与前沿模型 Agent 持平。单个静态提示词在尾部追加每个任务的状态后,在跨调用和跨任务之间保持字节级一致:最终提交的冻结提示词有 78% 的输入 token 来自缓存(在其热尾部为 86.6%),而在为期三周的开发语料中,由于提示词反复修改导致缓存重置,这一比例仅为 73%。这一设计将少量调用的优势叠加为名义输入计算量的一小部分。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。