首页 > 资讯 > 3D 重建下半场开幕,ECCV 首场14篇Spotlight 把高斯泼溅推到了哪儿

3D 重建下半场开幕,ECCV 首场14篇Spotlight 把高斯泼溅推到了哪儿

雷锋网 2026-09-10 17:31 1 阅读 查看原文
3D 重建的下半场,比的不再只是精度。

    作者丨陈淑瑜

    编辑丨岑   峰

                                                                                                       

9月8日,第19届欧洲计算机视觉大会(ECCV 2026)在瑞典马尔默拉开帷幕。
这场两年一届的视觉顶会创下历史之最:组委会收到超过一万篇有效投稿,最终接收2883篇论文,约6000名研究者从全球各地赶来参会。翻看议程不难发现,Gaussian Splatting (高斯泼溅)与 3D 重建是今年最拥挤也最热闹的赛道——光是第一个 Poster 环节,与 splatting 直接相关的论文就超过80篇,曾经的“新方法”已经成了整个领域的公共基础设施。
雷峰网&AI科技评论编辑团队提前为读者做了这份抢鲜梳理。大会 9 月 10 日才正式开幕,第一个论文报告专场——“3D Reconstruction, Gaussian Splatting & Neural Rendering”(3D重建、高斯泼溅与神经渲染)Spotlight Session 的 14 篇论文与海报已先一步在官网公开。我们从张贴的报告海报中精选 14 篇 Spotlight 论文,逐一梳理成文,先行呈现给关注 ECCV 的读者,以便现场报告开始前就能快速摸到今年 3D 视觉的脉搏。
从这14篇论文里,可以读出今年 3D 视觉的几个明确信号:
  • 其一,前馈式(feed-forward)重建正从“几张图重建”走向“长序列、大规模建图”,开始直接对标 SLAM;
  • 其二,视频扩散模型被大规模“驯化”成几何一致的新视角生成器,3D 基座模型负责提供“骨架”;
  • 其三,竞争从重建质量延伸到表示基元本身,三角形、子像素、谐波纹理轮番登场;
  • 其四,水下、遮挡、按需高清、主动扫描等真实世界场景,成了检验方法成色的试金石。

长视频一建图不跑偏:GRF-Recon 给前馈重建装上“全局光线场”

GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction
前馈式(feed-forward)3D重建能从图像序列高效地恢复场景,但把它推向“单目长视频”这类大规模输入时,三个老毛病会同时发作:GPU显存撑不住、局部几何容易走形、轨迹越走越偏,也就是累积漂移。现有的分块优化策略只是把长序列切开处理,块与块之间缺少几何约束,跑完一整条轨迹,全局一致性很难保证。
GRF-Recon 的思路是把“长”做成“协同”而不是“切碎”。它先用由粗到精的轨迹对齐搭好骨架,再通过 LoRA 把单目几何线索蒸馏进前馈骨干网络——只动少量参数,推理效率不掉。重建阶段引入“混合权重稀疏光线场优化”:用高频几何特征引导局部点云精修,同时以帧间光线约束把相邻帧“焊”在一起,建立起强跨帧几何耦合,这在以往的块式方法里是缺失的。最后,一条带联合光线误差优化的轨迹拼接策略,显式地把累积漂移压下去。
实验里,GRF-Recon 的轨迹精度能跟主流 SLAM 系统打平,同时在大规模场景中交出全局一致的重建结果。
“一次前向出模型”的可扩展性,和“边建图边纠偏”的稳定性,在这套框架里算是第一次真正合流。
论文链接:https://eccv.ecva.net/virtual/2026/spotlight/6009

无需水下标注即3D

Wat3R: Underwater 3D Geometry Learning without Underwater Annotations
水下环境光线衰减、散射严重,画面天然“雾蒙蒙”,再加上几乎没有大规模、高质量的3D标注可用,水下三维几何估计一直是块硬骨头。过去的方法大多靠海量稠密标注“喂”出来,这种路数在水下根本不现实,这正是水下3D重建长期落后于陆地的根源。
Wat3R 绕开了标注问题,提出一套跨域半监督学习框架,把前馈式3D重建模型从“陆地”迁到“水下”:采用教师-学生架构,只在大量无标注的真实水下视频上学习鲁棒的几何表示,全程不需要任何带标注的水下数据。
针对水对信息的衰减,作者还设计了一个跨视角一致性损失,让模型借用其他视角的几何线索,补偿当前视角“看不清”的部分。考虑到领域缺少评测基准,团队自建了 Water3D——一个覆盖多种水体与水下场景的数据集,专门用于几何任务评估。
结果显示,Wat3R 在水下多视角深度估计与点云重建上全面超过当前最好方法。把成熟的前馈重建模型带到水下、靠无标注数据完成迁移,这条路对遥感、医疗等同样“缺标注”的领域也有借鉴价值。
论文链接:https://arxiv.org/abs/2607.08772

给视频扩散装上“几何骨架”:新视角合成告别“扭麻花”

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis
用相机可控的视频扩散模型做新视角合成,效果一度惊艳,但这类模型骨子里只“看”像素、不懂三维结构:视角稍微一挪,画面里的物体会扭曲变形,相机的可控性也有限。问题出在几何只在输入端“打了一针”,没有贯穿生成的全过程。
GeoNVS 的办法,是把几何约束直接钉进特征空间。核心组件叫 Gaussian Splatting 特征适配器(GS-Adapter):先把输入视图的扩散特征“提升”成3D高斯表示,渲染出受几何约束的新视角特征,再与扩散特征做自适应融合,把几何上不一致的表征纠正过来。由于在特征层面操作,它避开了在输入端注入几何常见的视角相关颜色噪声,结构一致性因此更干净;而且这个适配器即插即用,不用额外训练就能兼容多种前馈几何模型,换其他视频扩散骨干也能接上。
在9个场景、18组设置的实验中,GeoNVS 相对 SEVA 和 CameraCtrl 分别提升11.3%和14.9%,平移误差最高下降2倍,倒角距离(Chamfer Distance)最高下降7倍。几何“准”了,画面自然就“稳”了。
论文链接:https://arxiv.org/abs/2603.14965

3D基座模型当“骨架”:几何一致的世界模型这样炼成

DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
能跟着用户自定义相机轨迹“逛”3D场景的视频扩散模型,正被视作世界模型的一种新形态。但现在的视频扩散大多只有隐式的时空表征,没有显式3D几何兜底,结果就是结构不合理、跨视角对不上号——看着像“世界模型”,其实是“像素魔术”。
DreamWorld 的做法是让两类模型“合体”:一边是3D基座模型扎实的空间结构先验,一边是视频扩散模型的高保真生成能力。给定输入图像和相机轨迹,模型先让一个“几何视频扩散模型”预测目标新视角的紧凑几何特征,把它当作显式的结构锚点;为了让扩散模型真正学会几何,作者用蒸馏范式把预训练3D基座模型的高层结构知识转给它。这些几何特征随后作为条件,交给另一个“外观视频扩散模型”合成最终视频——先定结构,再填外观。
几何与外观两阶段解耦,换来的是几何合理性与跨视角一致性的双提升。实验表明,DreamWorld 在视觉质量、3D一致性和相机可控性上都优于现有方法。
“先想清楚空间长什么样,再决定画面怎么画”,这个配方正成为几何一致视频生成的主流解。
论文链接:https://yanghb22-fdu.github.io/DreamWorld

几张无位姿照片加一句话,3D场景编辑一次搞定

Edit3r: Instant 3D Scene Editing from Sparse Unposed Images
想用一句话修改一个3D场景,通常的流程是先把场景重建好、再逐段优化编辑,费时费力。Edit3r 想做的是“单遍”完成:输入几张没有相机位姿标注的稀疏照片和一句编辑指令,直接端到端预测出符合指令的3D高斯场景。
而最大的拦路虎在训练数据,2D图像编辑天生带随机性,很难凑齐“视角一致的编辑后图像”来监督3D编辑模型。
作者用一个巧妙的“重构”绕开了它:把编辑重新定义成“换色”代理任务。先用一套基于SAM2的流程生成一张重着色参考视图,连同可靠的、跨视角一致的监督视图;再用非对称输入策略,把重着色参考视图与原始辅助视图配对喂给网络,逼它学会融合并对齐这些“对不齐”的观测。训练时模型只学换色,推理时却能接任意2D编辑器——自动消解跨视角冲突,输出连贯的3D编辑结果。
作者还发布了 DL3DV-Edit-Bench,一个大规模量化评测基准。结果显示 Edit3r 在语义对齐与3D一致性上超过近期基线,推理速度却快得多。不用多视角编辑监督、单遍出结果,这让“实时3D编辑”第一次离应用这么近。
论文链接:https://arxiv.org/abs/2512.25071

去不掉的路人先放一边:PriSplat 把被挡住的背景“补”回来

PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS
把 3D Gaussian Splatting(3DGS)用到不受控的真实世界,最头疼的是一闪而过的“瞬态干扰物”——路人、车辆、游客。现有方法的主流做法是训练时把干扰区域掩码掉、不算它们的损失,但这样一来,这些区域就失去了监督,模型会在每个视角各说各话地“脑补”,新视角里飘满伪影(floater)。问题不在“怎么遮”,而在“遮完以后那片空白谁负责”。
PriSplat 的解法是主动把背景补回来:把一个大规模视图合成先验改造成3D感知的修复引擎,并通过掩码感知的快速权重更新做适配,防止干扰物信息泄漏进场景记忆。作者设计了几何感知的支持视图选择算法,按信息密度和空间-角度约束挑出最可靠的参考帧,保证补出来的区域几何完整。
几个机制合起来,模型能从被掩码的区域重建出3D一致的伪真值,为训练重新建立稠密监督,伪影随之消失。实验显示 PriSplat 在合成质量与多视角一致性上双双超过最先进基线。真实世界的“脏”数据,从此不再是3DGS的禁区。
论文链接:https://eccv.ecva.net/virtual/2026/spotlight/6014

ReSplat:一次前向不够,就“循环”到对为止

ReSplat: Learning Recurrent Gaussian Splatting
前馈式 Gaussian Splatting 模型的一次前向推理就能重建场景,快、能泛化到稀疏视角,但“一步到位”也封死了它的上限——没有反馈,出错了也没机会改。ReSplat 提出让模型“循环”起来:迭代地精修3D高斯,却不用显式计算梯度。
关键洞察很直接:Gaussian Splatting 的渲染误差本身就是极好的反馈信号。拿它当“老师”,模型在测试时会自然适应没见过的数据分布,跨数据集、跨视角数、跨分辨率的鲁棒泛化因此水到渠成。为了让循环跑得动,作者用一个在1/16下采样空间里工作的紧凑重建模型做初始化,生成的高斯数量比逐像素模型少16倍,计算开销大幅降低,迭代更新因此变得轻快。
在输入视角数从2到32、分辨率从256×256到540×960、横跨 DL3DV、RealEstate10K 和 ACID 的实验中,ReSplat 都拿到最先进结果,同时显著减少了高斯数量、提升了渲染速度。用渲染误差当老师、循环自我修正,这个范式给可泛化3D重建指出了一个新方向。
论文链接:https://arxiv.org/abs/2510.08575

下一眼该看哪?SA-ResGS 给主动重建一双“会算账”的眼睛

SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection
机器人或无人机主动重建一个场景时,要不断决策“下一个最佳视角”(Next-Best-View)。难处在于:稀疏、大基线设置下,模型对那些没看过的区域几乎拿不到学习信号,不确定性估计常常失真,越不确定的地方越缺监督,越缺监督越估不准,陷入恶性循环。
SA-ResGS 先解决“覆盖度怎么估”:在观测训练视图与栅格化外推视图之间做三角化,生成几何一致的“自增广点云”(SA-Points),用来高效估计场景覆盖。随后,作者针对3DGS引入首个类残差学习的机制:用跳连思想放大对“贡献弱、不确定高”的高斯体的梯度流,让稀疏区域也能真正学到东西,而不是被淹没在强监督里。
论文的贡献主要体现在这三方面:物理上有依据的多样化视角选择策略、不确定性感知的残差监督(改善梯度流与训练稳定性)、以及由受限视角选择与残差监督共同带来的去偏不确定性量化。在 NeRF Synthetic、Mip-NeRF 360 以及 Deep Blending、Tanks and Temples 的扩展基准上,SA-ResGS 的重建质量和视角选择鲁棒性都稳定压过最先进方法。
论文链接:https://arxiv.org/abs/2601.03024

GaussianLens:像人一样“聚焦”,只对关心的区域做高清重建

GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
人看世界是有焦点的:逛超市会盯货架标签,回家会看墙上的全家福。主流3D重建却不讲这个道理,要么全场景均匀分辨率,又贵又冗余,原始高清图像根本训不动;要么靠启发式密度控制离线优化细节,需要密集观测、耗时漫长。想“放大看看关键区域”,两头都不讨好。
GaussianLens 把问题重新定义成“按需的局部高分辨率重建”:给定一个初始低分辨率3DGS重建,学习一个可泛化的稠密化网络:用户圈定兴趣区域(RoI)后,模型基于该区域稀疏的高分辨率观测,把局部重建“加密”出细节。它融合初始3DGS与多视角图像的多模态信息做前馈稠密化,并提出像素引导的稠密化机制,在分辨率大幅跳升时仍能稳定捕捉高频细节。
这样一来,既绕开了全场景高分辨率重建的高成本与冗余,又让关键区域吃满原始高清观测。实验表明,GaussianLens 在局部高保真细节重建上明显占优,且能扩展到最高1024×1024的输入图像。“关注什么就高清什么”,3D重建正在学着像人眼一样分配注意力。
论文链接:https://arxiv.org/abs/2509.25603

 SubSplat:低清输入也能渲染高清新视角

SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization
像素对齐式 Gaussian Splatting(每个像素对应一个高斯)高效又可泛化,却在高分辨率渲染上进退两难:输入分辨率提上去,细节有了,网络计算量却按平方上涨;输入分辨率压着不动,计算稳了,高斯密度又不够,画面出现伪影。保真与算力,成了只能二选一的跷跷板。
SubSplat 的破法叫“子像素高斯重参数化器”(SPGR):把每个主高斯细分成更细粒度的子基元,直接从低分辨率特征里恢复出结构密度,相当于用很少的额外计算,把丢失的空间细节补回来。为了让重参数化更可靠,作者又加了跨视图特征聚合,把多视角的高频信息融进来。
在 RealEstate10K 与 ACID 上,SubSplat 在保持优越效率的同时实现了更高保真的渲染,一举化解像素对齐式3DGS里“重参数化保真度”与“网络计算成本”的老矛盾。对想做高分辨率实时新视角合成的应用来说,这是一个性价比很高的答案。
论文链接:https://arxiv.org/abs/2607.20813

可变形三角形:让3D渲染基元学会“凹进去”

Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering
辐射场表示这两年从“高斯盘”卷到“三角形”,后者更贴合表面、光栅化也高效。但无论盘还是三角形,边界都是凸的——遇到弯曲、凹陷的结构,只能堆大量小基元去硬凑,又费又碎,还容易破绽百出。
这篇论文给每个三角形装上“变形能力”:每条边额外挂 K 个控制点,每个控制点只由一个可学习的标量位移参数驱动,就能把边界向内或向外推,从而表达非凸形状,同时保留决定3D平面的三个顶点。渲染环节配套重做:在三角形的重心坐标空间里做可微光栅化,用绕组数(winding number)测试判断像素是否落在变形后的基元内部,再靠锐度、角平滑度两个可学习参数与逐基元不透明度,生成从内部到边界平滑过渡的透明度。
在多种真实场景上,该方法在视觉质量与通用性上超过近期基于非体积基元的方法,渲染效率依然有竞争力。“三角形也会弯腰”,为非凸几何的实时渲染提供了一个更灵活的新基元选项。
论文链接:https://arxiv.org/abs/2607.22446

谐波纹理:给每个3D基元配一个“微型神经解码器”

Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction
以 3DGS 为代表的基元式表示,灵活、自适应、能扛大场景,这两年已是新视角合成的主流。但单个基元(比如一个高斯)的表达力有限,高频细节一多就顶不住,这是基元方法相对神经辐射场最常被诟病的一点。
Neural Harmonic Textures 的解法是给每个基元“外挂”一个可学习的特征载体:在基元周围放置虚拟脚手架,把潜在特征向量锚在上面,光线与基元相交时在交点处插值。受傅立叶分析启发,作者对插值后的特征施加周期激活,把alpha混合变成一组谐波分量的加权和,最后用一个小型神经网络做单遍(deferred)解码,把昂贵的逐点解码成本大幅压低。
它拿到了实时新视角合成的最先进结果,同时弥合了“基元派”与“神经场派”之间的差距;更重要的是通用性:能无缝嵌入 3DGUT、Triangle Splatting、2DGS 等现有基元管线,在2D图像拟合与语义重建上也有表现。“基元存结构、谐波补细节”,轻巧而有效。
论文链接:https://arxiv.org/abs/2604.01204

CubicSplat:可微矢量光栅化的“梯度跷跷板”被拆掉了

CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation
矢量图分辨率无关、体积小、可编辑,把它的参数化基元拿去可微优化很有吸引力。但经典光栅化对几何不连续,现有平滑前向的各种“补救”越做越繁,导致场景一复杂,启发式就失灵。作者把病根归结为一个“梯度跷跷板”:让前向几何更精确的改动,往往系统性劣化诱导出的梯度信号,反之亦然,两头难顾。
CubicSplat 用“误差有界的前向松弛”破局:用均匀折线代理替代 Bézier 最近点求解器,几何误差以 O(S⁻²) 的阶次有界,得到的是静态计算图,梯度天然良态,不用再跟病态梯度搏斗;再配一个基于合成(compositing)的可见性机制,无需额外正则化就能自动剪掉退化基元。
在 DIV2K 与 Kodak 基准上,闭填充(closed-fill)设置下重建质量达到最先进,PSNR 提升超过2dB,训练还比此前方法快最多4倍。“更准、更稳、更快”在图形学里向来难以兼得,这次三者都拿到了。
论文链接:https://arxiv.org/abs/2608.20803

TetraSDF:把神经SDF的“零面”精确地挖出来

TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid
从神经符号距离函数(SDF)里提取显式表面,难点在“精确”二字:Marching Cubes 这类采样式方法总有离散化误差,表面是“近似挖”出来的;而能做到解析精确的连续分段仿射(CPWA)方法,通常只支持朴素的ReLU MLP,学不动高频SDF。
TetraSDF 想把精确性与表达力两个都要。它用 ReLU MLP 复合一个多分辨率四面体位置编码来表示SDF,编码器里的重心插值保持了全局CPWA结构,于是可以在编码器诱导的多面体复形中追踪 ReLU 线性区域,实现零水平集的精确解析提取。作者还从编码器度量出发导出一个固定的解析输入预条件器,抑制方向偏置、稳定训练。
在多个基准上,TetraSDF 的SDF重建精度持平甚至超过现有网格编码器,同时能把网络的零水平集忠实地还原成三角网格。高表达力编码与可证明精确的表面提取,在这里第一次不再是二选一。
论文链接:https://arxiv.org/abs/2511.16273
从长序列建图到水下重建,从扩散世界模型到会变形的渲染基元,这14篇 Spotlight 论文像一组快照,记录下3D视觉正在发生的转变:重建不再只是“把照片变成模型”,而开始成为一种可编辑、可交互、按需高清、能直面真实世界脏数据的通用能力;表示层也在从“高斯”走向更丰富的基元家族,为更远的应用留出接口。
雷峰网&AI科技评论后续将持续跟进大会现场,带来更多 ECCV 2026 的精彩内容。如果你想推荐本届会议上的其他论文,或希望自己的研究成果出现在我们的报道中,欢迎联系我们进一步交流探讨。

为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」?

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注专区。