返回资讯列表
基于本体、经推理机验证的科学 AI LLM 推理评测基准

基于本体、经推理机验证的科学 AI LLM 推理评测基准

2026年10月2日作者:AI铺子编辑部
大模型学术

研究团队提出一种基于本体论自动生成科学推理评测基准的新方法。该方法从 OWL 2 本体构建多项选择题,正确答案以本体为依据,干扰项经推理机验证确保语义错误;在三个不同规模领域本体上生成逾1.7万道题目。

arXiv:2610.00682v1 公告类型:new 摘要:大型语言模型(LLM)日益支撑着在结构化知识上进行推理的科学 AI 应用,涵盖从生物医学问答到材料信息学等领域。然而,它们的逻辑推理能力往往不足,会产生在这些场景中不可接受的事实性错误。可靠的评估仍然充满挑战:人工构建数据集难以扩展,而基于 LLM 的生成方式又可能把试图衡量的缺陷嵌入其中。高质量的 benchmark 必须将正确和错误标注的样例都建立在明确的背景知识之上,并能由标准推理机进行形式化验证。我们提出了一条 pipeline,可从任何具有充分公理化的 OWL 2 ontology 自动生成基于本体论的多项选择题(MCQ)benchmark,并确保正确答案在设计上以 ontology 为依据。干扰项通过对类定义公理的右侧类表达式施加扰动来生成,其错误性由 OWL reasoner 通过 entailment 检查进行形式化验证。我们在三个 ontology 上评估了该 pipeline:Pizza(小型、学术性)、PMDco(复杂、材料科学)和 DOID(大型、生物医学),分别生成 112、2,491 和 15,216 道 MCQ。干扰项涵盖从类不可满足性到弱化 subsumption 的四个语义类别,从而能够对特定推理失败进行诊断式评估。题目达到自然语言质量标准:LLM judge 平均得分分别为 4.02、4.36 和 3.36(满分 5 分),确认了流畅性;正确答案与干扰项之间的相似度高于 0.8,表明错误选项无法仅凭表面形式排除。六个以 zero-shot 方式评估的 LLM 达到 41.1-76.8% 的准确率,远高于 25% 的随机猜测基线,说明这些 benchmark 具有挑战性和区分度。本工作是迈向更可靠评估科学 AI 逻辑推理 benchmark 的一步。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。