返回资讯列表
迈向代码 API 的交互式理解

迈向代码 API 的交互式理解

2026年9月29日作者:AI铺子编辑部
大模型学术产品

研究团队推出名为PAU的全新基准测试,专门评估大模型在无法查看源码时通过交互探索来理解外部Python API的能力。测试结果显示,包括Claude-4-Opus在内的顶尖模型仍有超过45%的样本无法正确理解。

arXiv:2609.32081v1 公告类型:new 摘要:在语言模型 Agent 进步的推动下,系统在代码生成与理解方面取得了长足进展。然而,这些方法通常依赖于对相关代码的读取权限,而在处理外部 API 时,这一假设并不成立。在本工作中,我们提出了 PAU(Python API Understanding)benchmark,为模型提供黑盒、API 级别的代码片段访问方式。模型必须通过探索性输入来查询 API,并从输出结果中提炼洞察,目标是描述代码片段的真实功能。PAU 将代码片段视为必须通过交互才能理解的外部工具,研究更具一般性的无监督工具理解问题,具体针对以 Python 方法实现的工具。尽管编码 Agent 近期进展显著,即使是前沿模型在 PAU 上也难以取得高分,表现最好的模型(Claude-4-Opus)仍无法理解 PAU 测试集中超过 45% 的样本。对常见错误模式的分析表明,模型存在过度自信的问题:它们往往高估当前假设的质量,导致探索不足并过早终止。最后,我们借鉴机器人学习中常用的非对称 Actor Critic(AAC)范式,对模型进行交互式代码理解的 post-train。采用 AAC 训练的模型会对 API 进行更主动的探索,经 AAC 微调的 Qwen3-8B 模型性能可与 GPT-5-mini 持平。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。