返回资讯列表
结构化 CoT 加持 Agentic AI,增强空间智能:旋转可视化与推理

结构化 CoT 加持 Agentic AI,增强空间智能:旋转可视化与推理

2026年10月6日作者:AI铺子编辑部
大模型学术

一项新研究考察了生成式Agentic AI在三维空间旋转推理上的表现。研究基于修订版Purdue旋转化测试,训练GPT-5.6模型理解空间旋转,并比较三种结构化CoT策略的效果。

arXiv:2610.04188v1 公告类型:new 摘要:近期研究表明,具备语言与视觉能力的人工智能(AI)在空间推理方面仍存在局限。本文研究了先进的生成式 AI 的空间能力,以理解物体在 3D 空间中的旋转,并利用了 AI 的图像处理与语言处理功能。我们基于修订版 Purdue 空间可视化测试——旋转化(Revised PSVT:R),训练并考察了一个生成式 Agentic AI 模型(GPT-5.6)的空间智能,以理解基于旋转图的空间旋转过程。我们对 Revised PSVT:R 进行了改进,叠加了额外的图形与上下文特征,以评估不同的 Chain-of-Thought(CoT)推理策略如何影响模型性能。结果表明,结构化 CoT 推理提升了基础 GPT-5.6 模型在两个数据集(PSVT:R 与带坐标系的 PSVT:R)上的空间推理性能。我们使用了三种 CoT 方法——(1) 结构化 CoT,(2) few-shot 结构化 CoT,以及带自优化提示(Self-optimized Prompt)的结构化 CoT。本研究评估的三种 CoT 方法之间未显示出显著的性能差异。结果显示,将结构化 CoT 推理与相关上下文信息相结合,可显著提升 VLM 在 3D 旋转任务上的表现,展示了 agentic AI 在更高效空间推理方面的潜力。然而,当上下文信息被移除后,仅靠结构化 CoT 推理带来的提升有限,模型在理解空间变换方面仍存在明显困难。这些发现表明,未来面向空间智能的 agentic AI 系统中,VLM 的有效空间推理依赖于视觉、文本与基于推理的信息的整合。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。