返回资讯列表

ARAFA:LLM 生成的阿拉伯语事实核查数据集
2026年9月23日作者:AI铺子编辑部
大模型
研究团队推出首个大规模阿拉伯语事实核查数据集Arafa,通过三步LLM流水线自动生成18万余条声明证据对。数据标签涵盖支持、反驳与信息不足三类,人工评估显示标注一致性极高。该框架为低资源语言构建类似资源提供了可扩展路径。
arXiv:2609.25833v1 公告类型:新发布
摘要:由于数据集和资源稀缺,自动事实核查在阿拉伯语自然语言处理领域构成重大挑战。在本手稿中,我们推出 Arafa——一个用于现代标准阿拉伯语事实核查的新型大规模数据集,该数据集通过利用大语言模型(LLM)的自动化框架构建。数据集构建采用三步流水线:(1)从阿拉伯语维基百科页面生成附带文本证据的声明;(2)对声明进行变异处理,以生成具有反驳证据的、具有挑战性的反事实声明;(3)自动验证步骤,验证所生成的声明是被伴随证据支持或反驳,还是证据未提供足够信息来判断声明的有效性。最终数据集包含 181,976 对声明-证据对,标签分为"支持"、"反驳"或"信息不足"。对数据集测试样本进行的人工评估显示,使用 Cohen's Kappa 计算,支持类声明的标注者间一致性很高(kappa = 0.89),反驳类声明的一致性为(kappa = 0.94)。基于人工评估样本的自动验证,对支持类声明达到 86% 的准确率,对反驳类声明达到 88% 的准确率。为展示 Arafa 作为阿拉伯语自动事实核查资源的价值,我们使用 Arafa 对四个开源的基于 Transformer 的模型进行了微调,其中表现最佳的模型在测试数据上取得了 77% 的宏 F1 分数(Macro F1-score)。除了 Arafa 是首个阿拉伯语事实核查大规模数据集之外,我们的框架还为其他低资源语言开发类似资源提供了一种可扩展的方法。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。