返回资讯列表
多模态大语言模型时代的三维影像AI
2026年8月24日作者:AI铺子编辑部
大模型
20549v1 Announce Type: new Abstract: 多模态大语言模型(MLLMs)的进展正推动放射学人工智能(AI)从特定任务图像分析向多模态理解与推理拓展
arXiv:2608.20549v1 Announce Type: new
Abstract: 多模态大语言模型(MLLMs)的进展正推动放射学人工智能(AI)从特定任务图像分析向多模态理解与推理拓展。然而,容积式放射学存在一个根本性的表征错配:临床判读通常需要全容积空间上下文及与采集方式相关的定量信息,而当前 MLLMs 通常基于筛选的二维(2D)图像、压缩视觉表征或报告衍生文本进行条件化。可靠的容积式放射学 AI 因此需要保留任务相关三维(3D)信息的表征,以及能够在临床工作流中访问、验证并整合这些信息的系统。在本综述中,我们审阅了截至 2026 年 7 月的 200 余篇文献。我们围绕模型层面的容积式表征与多模态理解、系统层面的 Agent 编排,以及它们与临床应用和评估的关联来组织文献。我们回顾了容积式基础模型、语言对齐与压缩策略,以及通过规划、工具、记忆和工作流交互扩展 MLLMs 的 Agent 系统。我们区分了筛选 2D 视图或报告介导推理即可满足需求的场景,与那些需要原生容积式建模的场景。我们还提出了一套"主张-设计-验证"(Claim-Design-Validation)框架,用于评估技术、工作流和临床主张是否得到相应设计与验证的支撑。纵观文献,原生容积式建模与 Agent 能力取决于目标任务的空間、定量、上下文及工作流需求。临床可信度需要忠实的容积式表征、可追溯的系统行为、与主张对齐的验证,以及在真实工作流中明确界定的人類监督。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。