返回资讯列表
OmniFysics-Nano-V2技术报告:跨模态理解物理世界

OmniFysics-Nano-V2技术报告:跨模态理解物理世界

2026年9月23日作者:AI铺子编辑部
行业动态

arXiv:2609.25738v1 公告类型:new 摘要:Omni-modal 模型已将多模态交互扩展到视觉、音频、语音和语言领域。然而,其训练主要围绕语义描述和通用目标展开,导致物理属性、交互状态和因果机制仅被部分刻画。

arXiv:2609.25738v1 公告类型:new 摘要:Omni-modal 模型已将多模态交互扩展到视觉、音频、语音和语言领域。然而,其训练主要围绕语义描述和通用目标展开,导致物理属性、交互状态和因果机制仅被部分刻画。这一缺口并非简单的模态覆盖问题:增加更多模态本身并不能提供将观察与世界物理结构联系起来所需的监督信号。我们提出 OmniFysics-Nano-V2,一个用于物理世界感知与理解的紧凑型 omni-modal 模型。该模型在共享推理框架内支持图像、视频、音频、语音和文本输入,并具备文本与语音生成能力。针对缺乏显式物理监督的问题,我们构建了双分支物理感知数据流水线,将显著对象落地到结构化的物理属性中,并将视觉变化与声学事件、中间响应及交互结果对齐。针对训练目标同质化的问题,我们按奖励多样性筛选强化学习提示词,并采用两阶段 Group Relative Policy Optimization 课程,从通用任务正确性逐步过渡到细粒度物理感知推理。跨多模态、视听和物理推理 benchmark 的实验表明,所提出的数据与训练策略在保持广泛 omni-modal 能力的同时,提升了物理世界理解水平。该模型在 21 个 benchmark 中的 17 个上取得了相对 SOTA omni-modal 模型的领先结果。通过为 AI 系统同时赋予 omni-modal 与物理世界感知能力,OmniFysics-Nano-V2 有望成为下一代 Physical AI 的基石。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。