返回资讯列表
Qwen3.8-Omni:迈向原生全模态 Agent

Qwen3.8-Omni:迈向原生全模态 Agent

2026年9月23日作者:AI铺子编辑部
行业动态

阿里推出原生全模态Agent模型Qwen3.8-Omni-Flash,采用稀疏MoE架构,上下文扩展至百万token,强化多模态理解推理与长周期任务表现,并开源Qwen-MM-Plugins与Qwen-Live-Harness框架。

arXiv:2609.25611v1 公告类型:新发布 摘要:我们推出 Qwen3.8-Omni-Flash,一款面向真实世界多模态生产力的原生多模态 agentic 模型。与此前主要强调感知与交互的 omni 模型相比,Qwen3.8-Omni-Flash 显著提升了多模态理解与推理能力,以及长周期 agentic 任务上的表现。这些能力得益于原生多模态共同训练策略:在保持强大文本领域能力的同时,促进 agentic 能力从文本向音频和视频任务迁移。该模型继承了 Qwen3.8-Next 的稀疏混合专家(MoE)架构,并将上下文窗口扩展至一百万 token,支持长上下文多模态推理和长周期规划。这些进展使其能够作为主力 agent 或专用子 agent 集成到生产工作流中,支持视频剪辑、长篇音频与视频翻译、音乐驱动的 MV 或电影生成,以及基于视频的笔记或 omni-skill 创建。针对现有 agent harness 缺乏原生音频和视频支持的问题,我们发布了 Qwen-MM-Plugins,一个用于多模态生产力的轻量级开源插件框架。我们进一步将实时多模态交互视为一项系统级挑战,需要统筹上下文与记忆管理、工具调用以及子 agent 委派。为此,我们发布了 Qwen-Live-Harness,一个基于 Qwen3.8-Omni-Flash 构建响应式实时多模态 agent 的开源框架。大量评估表明,Qwen3.8-Omni-Flash 在多模态理解、推理、长周期 agentic 执行和视频生产力任务上均取得了出色表现。这些结果与配套的开源工具共同表明,Qwen3.8-Omni-Flash 可作为在研究和生产环境中部署原生多模态 agent 的实用基础。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明