编辑丨岑峰
与此同时,在 3D 视觉和场景生成中,一个长期问题是如何把局部生成结果组织成全局一致的 3D 世界。现有视觉大模型在某些场景中仍可能出现跨视角结构不一致、物体数量或布局不合理等现象。
例如,当提示词中出现“卧室”时,模型有时会生成多张床;当虚拟相机在生成场景中进行较长距离漫游时,也可能出现建筑结构逐渐扭曲等问题。这些现象说明,模型从数据中学到的局部先验非常强,但对全局 3D 结构的约束仍然不足。引入显式的 3D 几何,可以为这些局部预测提供跨视角的结构约束,帮助构建更一致的全局结果。
在今年的欧洲计算机视觉国际会议(ECCV)上,香港科技大学教授谭平围绕这一问题介绍了团队近期在 3D 重建与 3D 场景生成方面的工作:学习方法提供强大的局部先验,3D 几何则用于组织和约束这些预测,从而提升大规模场景中的全局一致性与可扩展性。
谭平师从国际 3D 视觉泰斗权龙教授,长期从事 3D 视觉研究。本次演讲延续了这一方向,重点讨论如何把学习方法的表达能力与多视图几何、全局优化等经典 3D 方法结合起来。
在演讲中,谭平教授将 3D 重建与 3D 场景生成放在同一框架下讨论:无论是从图像重建 3D 世界,还是生成可漫游的 3D 场景,学习模型已经能够提供非常强的局部先验;而要把这些局部结果组织成全局一致的 3D 表示,几何结构与全局优化仍然具有重要作用。
在重建任务中,前馈网络高效且鲁棒,但在大规模输入和高精度位姿估计上仍有计算与一致性问题;团队借鉴视觉 SLAM/SfM 的关键帧思想,并结合集束调整(Bundle Adjustment)进行全局优化。在生成任务中,则通过显式 3D 布局或 3D 代理(Proxy)提供结构约束,再利用生成模型补充外观与细节,从而改善大场景漫游时的空间一致性。
这场演讲想强调的并不是学习方法与几何方法的二选一,而是二者的互补性:学习模型擅长从大规模数据中获得强大的局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。对于空间计算、世界模型和具身智能,这种“学习先验 + 几何约束”的结合值得进一步探索。
▎演讲标题:《几何的反攻:规模化 3D 重建与结构化 3D 场景生成》
今天我将分享我们近期在 3D 视觉和 3D 场景生成方面的工作。近年来,以 VGGSfM(或 DUSt3R 类前馈网络)为代表的基于大型 Transformer 的方法取得了很大进展。这类方法的基本思路非常直观:接收一组输入图像,提取特征,然后通过大型 Transformer 直接估计相机位姿、深度图和点云,并获得很强的局部 3D 重建效果。
01
大规模 SfM 方法:用“神经场景表示”
缓解 Transformer 的显存瓶颈
这一轻量化设计显著降低了全局建模时的显存开销,使方法能够扩展到更大规模的输入图像。
我们的方法能够处理更大规模的图像,并生成稠密、合理的 3D 点云与相机轨迹;与基线相比,因位姿不准导致的“重影”等伪影明显减少。在 Tanks and Temples 等复杂数据集的测试中,大约 70% 的情况下,相对旋转和相对平移误差都能控制在 5 度以内。
我还想分享一个关于“评估标准”的发现。过去,很多工作会把传统标杆算法 COLMAP 算出的相机位姿作为参考真值。但我们的研究也发现,COLMAP 本身存在估计误差,因此将其直接视为绝对真值也有一定局限。
为此,我们提取 90% 的输入图像,用我们的方法估计位姿并训练一个 NeRF 模型;最后在预留的 10% 未见视角上计算渲染图像的 PSNR(峰值信噪比)。结果显示,我们的方法在渲染质量和 PSNR 指标上优于以 COLMAP 位姿训练得到的结果。
02
Global 3R:
前馈网络与全局 SfM 的融合
至此,我们实现了前馈 3D 重建的规模化扩展。但在更大场景中,单纯依靠前馈预测仍可能出现误差累积和尺度不一致的问题。
于是我们提出第二个问题:能否将神经网络前馈方法的鲁棒性和效率,与传统全局 SfM 优化的几何精度结合起来,使系统同时兼顾可扩展性与全局一致性?
-
给定输入图像,首先提取滑动窗口。在每个滑动窗口内,应用前馈神经网络(例如类似CroCo/RoMa匹配网络)计算图像对之间的相对运动和点云等信息; -
接着,采用新方法在窗口内选择关键帧,并计算该关键帧与窗口内所有其他帧的匹配与对齐,从而获取一致的特征轨迹(feature track); -
构建位姿图,依次进行旋转平均和平移平均,最后执行集束调整,生成最终的3D结果。
在相机位姿精度方面,ETH3D 数据集上 1 度阈值下的结果表明,本方法取得了很高的旋转精度,在多个场景测试中该指标可达到 100%。
03
3D 场景生成:用“显式布局”
增强全局空间一致性
首先是受 Text2Room 启发的两项研究。Text2Room 能根据文本生成 3D 房间,其思路是利用图像扩散模型逐步生成不同视角,最终拼接成全景图。不过,由于生成过程主要在局部视角上调用扩散模型,缺少显式的全局 3D 场景布局(scene layouts)约束,因此有时会出现家具数量或空间布局不合理的问题。
在布局生成环节,模型使用向量编码物体的坐标、尺寸和方向,并拼接为统一代码序列。基于该代码空间和真实结构化数据训练扩散模型,同时引入视觉先验以学习房间陈设的常见规律(如卧室通常包含床等家具)。此外,为改善外观渲染时全景图左右边界的衔接,我们在扩散过程中引入随机循环平移(random circular shift),显式增强循环一致性。对比测试表明,没有显式布局约束时可能出现一间卧室生成多张床等不合理结果,而布局引导有助于生成更合理的家具配置。
04
SpatialCraft:单图推断 3D 代理,
解锁大场景的自由漫游
我们的第三项工作 SpatialCraft 进一步面向上述局限,采用两阶段策略。
第一阶段从单图生成 3D 代理(3D proxy)。通过在大量 3D 场景上训练的扩散模型,从单图推断出粗略的 3D 空间基底;在此基础上设置相机轨迹并渲染基础的 3D 漫游视频。第二阶段再引入视频扩散模型(video diffusion model),对基础视频进行 refinement,进一步提升纹理细节和视觉质量。
在第一阶段的技术细节中,核心是保持“像素对齐(pixel alignment)”以保留原始输入图像的特征。具体做法是将输入图像提升为深度图并转换为 3D 体素(voxels),利用网络补全场景中的不可见区域。这样可以让生成过程在可见区域与输入图像保持对齐,并为后续视角生成提供较稳定的 3D 结构;随后这些体素会被进一步处理为场景的 3D 高斯表示。
第二阶段则更侧重于“视频优化(video refinement)”。3D 代理已经提供了基础场景结构,可以对跨视角的空间关系形成约束;在此基础上,视频扩散模型重点优化画面的纹理细节和视觉质量。
实验结果表明,该方法不仅适用于室内场景,也能扩展到室外自然场景。即使相机进行较大范围移动,生成的漫游视频仍能较好保持空间一致性;在长视频生成测试中,相比现有基线,远离初始视角后仍能保持更稳定的场景结构。
总结而言,本次分享聚焦 3D 重建与 3D 场景生成两大方向。在 3D 重建中,深度学习前馈方法提供了强大的运动和结构先验,而多视图几何优化(如集束调整 BA)可以进一步提升全局精度与一致性。在 3D 场景生成中,现有大模型具备很强的局部生成能力,显式 3D 几何约束则有助于减少不合理结果,并支持更稳定的多视角与长距离生成。
因此,我更愿意把 3D 几何理解为连接“重建”与“生成”的脚手架(scaffold):基于学习的大模型为我们提供强大的局部先验,而经典几何帮助把这些局部信息组织成全局一致的 3D 结构。
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」?
-
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
-
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
-
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
-
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注雷峰网专区。