返回资讯列表
人机编码对比:课堂观察 AI 评分评估研究

人机编码对比:课堂观察 AI 评分评估研究

2026年9月17日作者:AI铺子编辑部
学术

18274v1 公告类型:新发布 摘要:课堂观察被广泛认可为确立教育质量基准和指导教学改进的关键工具,然而其资源密集且依赖受过训练的观察者

arXiv:2609.18274v1 公告类型:新发布 摘要:课堂观察被广泛认可为确立教育质量基准和指导教学改进的关键工具,然而其资源密集且依赖受过训练的观察者。本研究评估了使用 LLM(GPT-5 模型)对幼儿课堂中教师-儿童互动进行评分的可行性,并以人类评分者作为基准。研究分析了来自香港 30 所幼儿园 38 个班级的 87 份视频录制观察。研究使用观察转录文本,将 AI 模型配置为应用完整的课堂评估评分系统(CLASS)框架。随后通过考察 CLASS 领域和维度上 AI 评分与人类评分的相关性及平均分差异,对二者进行了比较。结果显示,AI 与评分者在情感支持领域,尤其是"反馈质量"维度上表现出更高的一致性,该维度捕捉教师如何利用反馈拓展儿童的学习。而对于更具程序性或情境依赖性的互动,则出现了更大的分歧,主要体现在课堂组织和教学支持领域。这些发现表明,基于转录文本的 AI 评分或许能够捕捉教师-儿童互动中的部分相对差异,但尚无法在整个 CLASS 框架内一致地复现经过校准的人类判断。因此,AI 辅助观察更适合作为初步筛查工具,而非取代受过训练的观察者,为教师提供反思的证据,而非高风险评估。未来研究应考察领域特定训练以及情境和视觉信息的纳入能否改善 AI 评分与人类评分之间的一致性。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明