返回资讯列表
从单体融合到 Agent 编排:大规模对话助手的动态响应方案

图源:arXiv cs.AI

从单体融合到 Agent 编排:大规模对话助手的动态响应方案

2026年9月9日作者:AI铺子编辑部
行业动态

05758v1 公告类型:新发布 摘要:对话式助手可以将检索、动作选择、升级与措辞整合在单一模型路径中,也可以将这些角色分离开来

arXiv:2609.05758v1 公告类型:新发布 摘要:对话式助手可以将检索、动作选择、升级与措辞整合在单一模型路径中,也可以将这些角色分离开来。我们报告了一次在一家大型住宿预订平台(每月数百万次对话、11 种语言、P90 延迟 10 秒)上客户支持助手的生产环境迁移。Dynamic Response(DR)用一个有边界的 ReAct 编排器(作用于带类型的工具集)加上一个更小的生成器(依据经后端验证的上下文契约进行撰写),取代了原先单一的 Qwen3-235B-A22B 融合式响应器。由于此次迁移同时改动了提示词、对齐方式和服务架构,我们将每项效果归因到其对应原因,并且仅将那些在完全相同的回放对话轮次上测得的结果声称为架构效应:带类型的实体选择将预订选择器推至精度优先的工作点(精度从 8.3% 提升至 89.1%,召回率从 75.2% 降至 67.3%);带类型动作 ID 配合成员资格校验消除了观测到的结构化动作幻觉(从 2.14% 降至 0.0%)。一次低流量爬坡 A/B 测试复现了回放中的升级减少趋势:硬升级响应从 5.60% 降至 3.08%,软升级响应从 9.56% 降至 2.49%,而生产环境中的转人工量大致保持稳定;自助解决率呈正向趋势(+5.1 个百分点,95% CI [-2, +12])。服务优化将编排器 P90 延迟从 3.87s 降至 2.24s,GPU 占用规模缩减约三分之一;采用自托管使估算的年度模型服务成本降低了一个数量级以上。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明