返回资讯列表
多模型LLM简答题评分的信度、效度与诊断证据

图源:arXiv cs.CL

多模型LLM简答题评分的信度、效度与诊断证据

2026年9月9日作者:AI铺子编辑部
大模型

06315v1 公告类型:新发布 摘要:大语言模型(LLM)在教育评分中的应用日益增多,但单一模型、单次运行的评估为考核用途提供的证据有限

arXiv:2609.06315v1 公告类型:新发布 摘要:大语言模型(LLM)在教育评分中的应用日益增多,但单一模型、单次运行的评估为考核用途提供的证据有限。简答题评分需要关于可靠性、效度、评分严格程度、诊断价值以及失败案例的证据。本研究评估了基于 OCG-PRES 框架的多模型重复运行 LLM 评分方法在简答题测评中的表现。分析使用了 996 份 SciEntsBank 作答。GPT、DeepSeek 和 Qianwen 三个模型分别对每份作答在三个独立运行中,按照 OCG-PRES 的五个维度进行评分:概念覆盖度、关系准确性、推理完整性、矛盾控制和领域相关性。评分结果与官方的二分类和五分类标签进行比对,并与多个非 LLM 基线方法进行了比较,包括基于答案长度、Jaccard 关键词重叠、TF-IDF 余弦相似度以及一个传统逻辑回归组合模型。所有模型的重复运行可靠性均较高,ICC(3,k) 分别为:GPT .977、DeepSeek .992、Qianwen .981。其中 DeepSeek 在多次运行间最为稳定。GPT 在 AUC(.909)指标上与官方标签的对齐度最高,而 Qianwen 评分更为严格,在固定阈值 = 3.0 规则下表现出更高的精确率但较低的召回率。OCG-PRES 评分在五个官方分类上呈现出预期的诊断模式,并在 AUC 和 F1 指标上均优于所有非 LLM 基线方法。重复运行的多模型 OCG-PRES 评分可为 LLM 辅助简答题评分提供可靠性、效度和诊断性证据。研究结果支持将 LLM 作为一种有评分依据的辅助工具谨慎使用,而非替代人工判断。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明