返回资讯列表

Qwen3.8-Omni:迈向原生全模态智能体
2026年9月23日作者:AI铺子编辑部
大模型产品
阿里推出原生多模态智能体模型 Qwen3.8-Omni-Flash,强化多模态理解推理与长程任务能力。其基于 Qwen3.8-Next 的 MoE 架构,上下文窗口扩至百万 token。
arXiv:2609.25611v1 公告类型:new
摘要:我们推出 Qwen3.8-Omni-Flash,一款面向真实世界多模态生产力的原生多模态智能体模型。与以往主要侧重感知与交互的 omni 模型不同,Qwen3.8-Omni-Flash 大幅提升了多模态理解与推理能力,并在长程智能体任务上表现更佳。这些能力得益于原生多模态联合训练策略:在保持强文本领域能力的同时,促进智能体能力从文本向音频和视频任务迁移。该模型继承了 Qwen3.8-Next 的稀疏混合专家(MoE)架构,并将上下文窗口扩展至一百万 token,支持长上下文多模态推理和长程规划。这些进步使其能够作为主力智能体或专用子智能体集成到生产工作流中,支持视频剪辑、长音频与长视频翻译、音乐驱动的 MV 或电影生成,以及基于视频的笔记或 omni-skill 创建。针对现有智能体运行框架缺乏原生音频和视频支持的问题,我们发布了 Qwen-MM-Plugins,一个面向多模态生产力的轻量级开源插件框架。我们进一步将实时多模态交互视为系统级挑战,需要对上下文与记忆管理、工具使用以及子智能体委派进行统筹调度。为此,我们发布了 Qwen-Live-Harness,一个基于 Qwen3.8-Omni-Flash 构建响应式实时多模态智能体的开源框架。大量评估表明,Qwen3.8-Omni-Flash 在多模态理解、推理、长程智能体执行和视频生产力任务上均取得了强劲表现。这些结果及配套开源工具表明,Qwen3.8-Omni-Flash 可作为在研究和生产环境中部署原生多模态智能体的实用基础。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。