返回资讯列表
一个微调模型能否通吃?客服 LLM 微调策略选择

一个微调模型能否通吃?客服 LLM 微调策略选择

2026年9月24日作者:AI铺子编辑部
大模型学术

研究团队系统比较了客服场景下单一模型与多专家模型的微调策略。实验覆盖五个模型家族、十三个模型及八个数据集,结果显示多任务全量微调在各规模上均为最优默认方案。专家模型在目标外任务退化明显,顺序 LoRA 与模型合并则展现出更好的技能保留与鲁棒性。

arXiv:2609.27262v1 公告类型:新提交 摘要:生产环境的客户支持系统通常要求 LLM 具备多种技能,例如意图分类、问答、摘要或工具调用决策。一个核心的部署问题是:这些技能应该由独立的任务专家模型分别处理,还是由通过多任务训练、顺序更新或模型合并得到的单一模型来处理。我们围绕这一问题开展了研究,选用了横跨五个模型家族(Qwen3、Qwen3.5、Gemma-3、Llama-3.1 和 Mistral)、参数量从 0.6B 到 32B 的十三个模型,并在八个客户支持数据集上进行实验,其中包括四个公开数据集和四个专有数据集,约有 74.5k 条训练样本和 8.7k 条评估样本。在固定的训练协议下,我们训练了超过 200 个 checkpoint。实验结果表明,在我们测试的每一个模型规模上,多任务全量微调都是最强的默认部署方案。专家模型在其目标任务上表现强劲,但在目标任务之外往往急剧退化,这使得可靠的路由机制变得尤为重要。顺序 LoRA(Low-Rank Adaptation)比顺序全量微调更能保留先前学到的技能,而将专家模型与其基座模型合并,则能在较大模型上以有限的目标任务性能损失换取更强的任务外鲁棒性。最后,我们针对真实场景下的微调策略选择给出了实践性建议。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。