返回资讯列表

CompMat-Bench:计算材料科学 AI Agent 基准测试
2026年10月2日作者:AI铺子编辑部
学术
CompMat-Bench 是面向计算材料科学的 AI Agent 基准测试。它收录 94 项真实研究任务,通过预复现结果作为标准答案,避免实际运行高成本模拟;测试显示 Agent 在完整指导下通过率为 66.0% 至 90.4%。
arXiv:2610.00636v1 公告类型:new
摘要:在科研任务上评估 AI agent 受限于底层实验或计算所需的时间与资源。在计算材料学研究中,跨 agent、跨试验重复运行同样的高成本模拟,会让评估变得不切实际。我们推出 CompMat-Bench——一个包含 94 项任务的 benchmark,任务取自近期发表的计算材料学研究,每项任务要求 agent 完成朝向该研究科学目标的一步。我们预先复现了这些研究步骤,并让 agent 负责为高成本模拟准备输入、分析输出,从而避免在评估过程中实际运行高成本模拟。复现得到的输入与结果作为 ground truth,通过固定规则对 agent 评分,无需 LLM judge。该 benchmark 支持四种评估条件:单一任务,以及由相关任务组成的工作流,各自又分完整方法指导与精简方法指导两档。在单一任务且给予完整指导的条件下,基于三个 LLM 的 agent 展现出完成单个材料研究步骤的能力,在 94 项任务上的通过率为 66.0-90.4%。更长的工作流和精简的指导都会限制 agent 的表现,但对不同 agent 的影响方式不同:它们会拉低较弱 agent 的通过率,而最强的 agent 只有在长工作流与精简指导叠加时才会失手。失败分析表明,大多数失败源于科学层面的错误,而非软件使用上的错误。CompMat-Bench 为比较 agent 在真实材料研究步骤上的表现、分析 agent 的失败模式提供了基础。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。