返回资讯列表

图源:arXiv cs.CL
TalkFa:波斯语对话生成与理解的统一基准测试
2026年9月3日作者:AI铺子编辑部
行业动态
01810v1 Announce Type: new 摘要:波斯语(Farsi)拥有超过1
arXiv:2609.01810v1 Announce Type: new
摘要:波斯语(Farsi)拥有超过1.2亿使用者,却缺乏一个全面的对话生成与理解 benchmark。本文推出 TALKFA,一个统一的 benchmark,包含三个互补数据集:(1)WIKI-FADIAL,4.2K 条基于维基百科的知识驱动对话,用于知识 grounded 生成;(2)DAILYDIALOG-FA,6.6K 条标注了对话行为(dialogue acts)与情感的对话;(3)PLAYDIAL-FA,2.1K 条带有情感标签的戏剧对话。虽然 LLM 辅助了数据构建,但每条对话均经过母语为波斯语者的多轮审阅与修订,仅发布最终经人工核准的对话。针对六种 LLAMA 和 MISTRAL 模型的实验表明,LoRA 显著提升了对话生成效果,且仅需 25%-50% 的训练数据即可恢复超过 90% 的最终性能增益。在分类任务中,FABERT 取得最佳的对话行为识别表现,LORA-MISTRAL-7B 在情感识别上表现最优,MISTRAL-24B 则获得最高的情感分析得分。人工评估与独立外部验证证明了该 benchmark 的可靠性,而与 GPT-4.1 作为 LLM judge 的对比则揭示,自动指标显著高估了对质量。前沿 LLM 的零样本评估进一步表明,TalkFa 仍是一个具有挑战性的 benchmark。我们将发布全部数据集、标注指南、代码及 checkpoint。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。