返回资讯列表
LLM 何时取代微调 NLU?生产对话系统中意图检测的决策框架

LLM 何时取代微调 NLU?生产对话系统中意图检测的决策框架

2026年8月24日作者:AI铺子编辑部
大模型

20371v1 Announce Type: new Abstract: 一种常见说法是,zero-shot 大语言模型(LLM)可以替代微调 NLU 分类器用于意图检测

arXiv:2608.20371v1 Announce Type: new Abstract: 一种常见说法是,zero-shot 大语言模型(LLM)可以替代微调 NLU 分类器用于意图检测。我们对此进行了正面验证,发现诚实的答案是:这取决于意图空间。在完整的 ATIS 和 CLINC150 数据集上,我们对比了微调 RoBERTa、TF-IDF+逻辑回归基线、句子嵌入 kNN 以及 Claude Haiku zero-shot,报告了 bootstrap 95% 置信区间和配对显著性检验。当存在丰富的领域内标注数据时,微调 RoBERTa 表现相当或更优,且成本与速度低三个数量级:在 ATIS 上,它以 11.8 个百分点击败 Claude zero-shot(95.9 vs. 84.1,p<0.001)。在涵盖 150 个意图的 CLINC150 体系下,两者统计上持平(89.1 vs. 88.5,p=0.24):LLM 无需训练数据即可匹敌全监督模型。LLM 的优势体现在三个与生产相关的场景:out-of-scope 检测(OOS recall 85.6 vs. RoBERTa 的 58.1);通过受控的 text-to-speech 到噪声再到 Whisper 流程实现对真实 ASR 噪声的鲁棒性(0 dB 下 92.5 vs. 80.0);以及动态 per-deployment schema,其中在一个应用意图上训练的分类器在新应用意图上得分为 0%,而基于 schema prompt 的 LLM 无需重新训练即可为两者提供约 94% 的服务。我们将这些发现提炼为面向实践者的决策框架。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明