首页 > AI前沿 > Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

arXiv自然语言 2026-09-30 01:59 7 阅读 查看原文

背景与挑战

从多视角图像推理3D世界是Multimodal Large Language Models (MLLMs)的一个基本挑战。虽然现代MLLMs在处理单图像输入方面非常有效,但它们在将证据整合到连贯的3D理解中时却遇到了困难。

大量工作试图通过将3D意识注入MLLMs来填补这一差距,要么通过增强细粒度的像素级跨视图对应关系,要么通过融合来自3D几何基础模型的特征,然而与人类推理之间仍然存在很大的差距。

人类空间推理

在这个工作中,我们重新审视人类的空间推理,这表明人类不是依赖于细粒度的几何线索,而是大致识别视图之间的共同物体,推断视图之间的相对几何关系,并组装场景的粗略3D布局。

Imagine3D-LLM

受此过程的启发,我们引入了Imagine3D-LLM,这是一个MLLM,它学习组装场景的类似紧凑3D表示,并基于这个表示来条件化其答案。具体来说,我们在图像标记之后添加了一小批可学习的摘要标记,将它们解码成一个紧凑的3D高斯分层表示,该表示由光度重建损失进行监督,并与标准下一个标记预测目标联合训练。

值得注意的是,尽管只有摘要标记直接接收重建监督,但这个目标也导致了LLM底层图像特征中的更强跨帧对应关系,这表明学习重建会传播3D意识信号,遍及整个模型。

结果与结论

作为结果,Imagine3D-LLM在多个空间推理和3D理解基准测试中始终优于先前的方法,这表明想象场景可能比被告知其像素级几何更有效。