返回资讯列表
何时调用 LLM:面向对话式 AI 低成本情感识别的置信度门控混合方法
2026年9月17日作者:AI铺子编辑部
大模型
17977v1 公告类型:新发布 摘要:对话中的情感识别(ERC)是联络中心即服务(CCaaS)平台中坐席辅助提示、升级路由和通话后分析背后的生产能力,在这些场景中,成本和延迟约束与准确性同等重要
arXiv:2609.17977v1 公告类型:新发布
摘要:对话中的情感识别(ERC)是联络中心即服务(CCaaS)平台中坐席辅助提示、升级路由和通话后分析背后的生产能力,在这些场景中,成本和延迟约束与准确性同等重要。我们针对对话上下文感知的 ERC 的三种部署选项进行了系统级比较:低成本堆叠集成模型(句向量、窗口化上下文、RandomForest/XGBoost/逻辑回归堆叠)、现成 LLM 提示方法(GPT-4o-mini;零样本、少样本、思维链),以及一种置信度门控的混合架构——仅将集成模型中置信度最低的预测升级到 LLM 处理,其建模灵感来自生产级联络中心采用的 IVA 到人工坐席升级策略。在 IEMOCAP 数据集上,该集成模型以显著优势超越所有 LLM 配置(加权 F1 为 0.595 对比 0.460-0.536,p < 0.0001),且成本仅为后者的一小部分,延迟低于 10 毫秒;而在 MELD 和 CMU-MOSI 数据集上排名发生反转,表明任何单一系统都无法作为稳妥的默认选择。置信度门控混合架构通过在全部三个数据集上实现对两种纯系统的帕累托占优(加权 F1 分别为 0.620、0.643、0.824),同时将大部分流量路由至近零成本的集成模型,从而解决了这一矛盾;换算成本约为每百万话语 10-85 美元,而纯 LLM 流水线则需 99-170 美元。该升级策略并非一个不透明的成本/准确性调节旋钮:被升级的话语中,情感或情绪转变后出现的比例明显更高,为运营人员提供了一个可解释、可审计的路由信号;同时,集成模型的置信度校准良好,且偏向保守而非过度自信。这一模式在三个数据集和两个 LLM 提供商上均保持一致。置信度门控级联在通用 ML 系统中已有先例;我们的贡献在于证明它能无缝迁移到对话上下文感知的 ERC,为正在决定如何分配 LLM 预算的 CCaaS 和对话式 AI 平台提供了一套具体的部署方案。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。