返回资讯列表

图源:arXiv cs.AI
OpenDiscoveryTrace:评估 AI 科学家工作流的过程追踪数据集
2026年9月11日作者:AI铺子编辑部
行业动态
09203v1 公告类型:新发布 摘要:现有的自主 AI 科学家 benchmark 仅评估最终产出——生成的代码、假设或论文——却丢弃了获得这些产出的推理过程
arXiv:2609.09203v1 公告类型:新发布
摘要:现有的自主 AI 科学家 benchmark 仅评估最终产出——生成的代码、假设或论文——却丢弃了获得这些产出的推理过程。这使得审计科学方法论、诊断失败模式或区分系统性推理与幸运猜测变得不可能。我们推出 \textbf{OpenDiscoveryTrace},这是一个包含 558 条完整 AI 科学 agent 轨迹的公开数据集,它捕捉的是模型如何推理,而不仅仅是模型产出了什么。每条轨迹记录了一个结构化的每步 9 字段追踪——包括思考、工具调用、观察、错误、修订触发因素以及自报置信度——记录了模型执行 124 项科学任务的过程,任务涵盖药物发现、材料科学、基因组学和科学文献分析。数据集覆盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;各 124 条轨迹,在领域和难度级别上完全平衡)和四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;各 30 条),外加 60 条实时检索变体轨迹。对 363 条经 LLM 评判的轨迹进行的初步分析表明,过程追踪能够暴露仅以输出评估无法看到的行为差异:三个前沿模型的成功率相当(84–89%),但 Claude Opus 4.6 产生的错误数量是 GPT-5.4 的 30$\times$(每条轨迹 2.5 次 vs. 0.08 次,$p < 0.0001$,Cliff's $\delta = 0.613$),且错误特征在质性上截然不同——Claude 的错误中 66.7% 为工具误用,而 GPT-5.4 的错误中 83.6% 为推理错误。我们定义了五项 benchmark 任务,并给出了 logistic 回归、随机森林、LSTM 和 Transformer 模型的基线。数据集、追踪 schema、agent 运行框架和 benchmark 定义均以 CC BY 4.0 协议公开提供,以支持过程级评估、科学 agent 审计和 AI 治理方面的研究。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。