返回资讯列表

OmniFysics-Nano-V2 技术报告:跨模态理解物理世界
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.25738v1 公告类型:new 摘要:Omni-modal 模型已将多模态交互扩展至视觉、音频、语音和语言。然而,其训练主要围绕语义描述和通用目标展开,导致物理属性、交互状态和因果机制仅被部分刻画。
arXiv:2609.25738v1 公告类型:new
摘要:Omni-modal 模型已将多模态交互扩展至视觉、音频、语音和语言。然而,其训练主要围绕语义描述和通用目标展开,导致物理属性、交互状态和因果机制仅被部分刻画。这一缺口并非仅仅是模态覆盖的问题:增加更多模态本身并不能提供将观察与世界物理结构联系起来的监督信号。我们提出 OmniFysics-Nano-V2,一个面向物理世界感知与理解的紧凑 omni-modal 模型。该模型在共享推理框架内支持图像、视频、音频、语音和文本输入,并支持文本与语音生成。针对缺乏显式物理监督的问题,我们构建了双分支物理感知数据流水线,将显著对象锚定在结构化的物理属性上,并将视觉变化与声学事件、中间响应和交互结果对齐。针对训练目标同质化的问题,我们按奖励多样性筛选强化学习提示,并采用两阶段 Group Relative Policy Optimization 课程,从通用任务正确性逐步推进到细粒度物理感知推理。跨多模态、视听和物理推理 benchmark 的实验表明,所提出的数据与训练策略在保持广泛 omni-modal 能力的同时,提升了对物理世界的理解。所提出模型在 21 个 benchmark 中的 17 个上取得了相对 SOTA omni-modal 模型的领先结果。通过为 AI 系统同时赋予 omni-modal 与物理世界感知能力,OmniFysics-Nano-V2 有望成为下一代 Physical AI 的基石。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。