返回资讯列表
OpenDiscoveryTrace:评估 AI Scientist 工作流的过程轨迹

图源:arXiv cs.AI

OpenDiscoveryTrace:评估 AI Scientist 工作流的过程轨迹

2026年9月10日作者:AI铺子编辑部
行业动态

09203v1 公告类型:new 摘要:现有的自主 AI 科学家 benchmark 仅评估最终产出——生成的代码、假设或论文——却丢弃了获得这些产出所依赖的推理过程

arXiv:2609.09203v1 公告类型:new 摘要:现有的自主 AI 科学家 benchmark 仅评估最终产出——生成的代码、假设或论文——却丢弃了获得这些产出所依赖的推理过程。这使得人们无法审计科学方法论、诊断失败模式,也无法区分系统性推理与侥幸猜中。我们提出 \textbf{OpenDiscoveryTrace},这是一个包含 558 条完整 AI 科学 agent 轨迹的公开数据集,它捕捉的是模型如何推理,而不仅仅是模型产出了什么。每条轨迹记录了结构化的逐步 9 字段 trace——包括思考、工具调用、观察结果、错误、修订触发因素以及自报置信度——覆盖模型执行 124 项科学任务的过程,任务横跨药物发现、材料科学、基因组学和科学文献分析。该数据集涵盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;各 124 条轨迹,在领域和难度级别上完全均衡)和四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;各 30 条),外加 60 条实时检索变体轨迹。基于 363 条由 LLM 评判的轨迹所做的初步分析显示,过程 trace 能够暴露仅以输出为评估方式所无法察觉的行为差异:三个前沿模型的成功率相当(84--89%),但 Claude Opus 4.6 产生的错误数量是 GPT-5.4 的 30$\times$(每条轨迹 2.5 次 vs. 0.08 次,$p < 0.0001$,Cliff's $\delta = 0.613$),且错误特征在性质上截然不同——Claude 有 66.7% 为工具误用,而 GPT-5.4 有 83.6% 为推理错误。我们定义了五项 benchmark 任务,并给出 logistic 回归、随机森林、LSTM 和 Transformer 模型的基线。数据集、trace schema、agent harness 和 benchmark 定义均以 CC BY 4.0 协议公开提供,以支持过程级评估、科学 agent 审计和 AI 治理方面的研究。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明