返回资讯列表

TelecomGPT-R1:面向异构电信任务推理的统一后训练
2026年9月23日作者:AI铺子编辑部
大模型
arXiv:2609.25356v1 公告类型:新发布 摘要:大语言模型(LLM)在自动化各类电信工程任务方面展现出巨大潜力,可对标准规范、网络配置、数学模型、源代码及运维日志进行推理。
arXiv:2609.25356v1 公告类型:新发布
摘要:大语言模型(LLM)在自动化各类电信工程任务方面展现出巨大潜力,可对标准规范、网络配置、数学模型、源代码及运维日志进行推理。然而,现有电信领域 LLM 难以在这类多样化任务与数据类型上实现可靠推理。通用 LLM 往往缺乏对电信专业知识的可靠锚定,而电信专用模型通常面向较窄的任务族开发,多任务表现有限。为填补这一空白,我们提出 TelecomGPT-R1——一个围绕四个互补维度(协议、知识、建模、故障)构建的开源统一电信推理模型系列。我们首先开发了维度感知的数据生成框架,将粗粒度的公开电信资料精炼为经验证的问答对和高质量思维链(CoT)推理轨迹,形成包含 104,880 个样本的训练语料。在此基础上,监督微调(SFT)向模型注入电信知识与基于证据的推理模式,克服强化学习(RL)的冷启动障碍。随后,我们采用动态采样策略优化(DAPO),并结合按任务路由的评分量规奖励,使 RL 更新在异构电信推理任务中保持信息丰富且稳定。这些奖励将特定维度的 CoT 轨迹分解为可验证的推理单元,并把基于证据的稠密过程信用与结果正确性相结合,使 RL 能够从可验证的电信证据中学习可泛化的问题求解行为。我们开源了 TelecomGPT-R1 模型及可复现的训练配方,以支持社区进一步开发。在 GSMA Open Telco Leaderboard 的七个 benchmark 评测中,开源的 TelecomGPT-R1-27B 取得 89.64% 的平均分,超越包括 GPT-5、Claude 和 Gemini 在内的领先专有模型。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。