[论文解读] Splatter Image: Ultra-Fast Single-View 3D Reconstruction
Splatter Image 提出了一种基于学习的超快速单视角与少视角 3D 重建方法,采用高斯点阵(Gaussian Splatting)技术,其中一个 2D U-Net 网络预测一个“点阵图像”——一种伪图像,每个像素编码一个 3D 高斯分布。该方法在单个 GPU 上实现 38 FPS 推理速度,在 ShapeNet 和 CO3D 基准测试中达到最先进性能,PSNR 和 LPIPS 指标优于更慢的基线方法,且训练效率高。
We introduce the \method, an ultra-efficient approach for monocular 3D object reconstruction. Splatter Image is based on Gaussian Splatting, which allows fast and high-quality reconstruction of 3D scenes from multiple images. We apply Gaussian Splatting to monocular reconstruction by learning a neural network that, at test time, performs reconstruction in a feed-forward manner, at 38 FPS. Our main innovation is the surprisingly straightforward design of this network, which, using 2D operators, maps the input image to one 3D Gaussian per pixel. The resulting set of Gaussians thus has the form an image, the Splatter Image. We further extend the method take several images as input via cross-view attention. Owning to the speed of the renderer (588 FPS), we use a single GPU for training while generating entire images at each iteration to optimize perceptual metrics like LPIPS. On several synthetic, real, multi-category and large-scale benchmark datasets, we achieve better results in terms of PSNR, LPIPS, and other metrics while training and evaluating much faster than prior works. Code, models, demo and more results are available at https://szymanowiczs.github.io/splatter-image.
研究动机与目标
- 通过高效的深度学习方法实现实时、高质量的单目图像 3D 重建。
- 通过利用高斯点阵的速度与质量优势,克服如 NeRF 等隐式 3D 表示方法的计算瓶颈。
- 设计一种训练高效的框架,即使在视图有限的情况下,也能通过感知指标(如 LPIPS)实现全图监督。
- 通过引入跨视角注意力机制与相对相机位姿,将方法扩展至多视角重建,避免对绝对位姿的依赖。
- 在极低计算成本下实现最先进水平的重建质量,支持在单张 GPU 上完成训练与推理。
提出的方法
- 该方法使用基于 2D U-Net 的图像到图像网络,预测一个“点阵图像”——一种二维特征图,其中每个像素编码一个 3D 高斯分布的三维位置、颜色、不透明度和形状。
- 每个预测的 3D 高斯分布通过高斯点阵技术进行渲染,实现在 588 FPS 下的快速且高质量渲染,将渲染过程与训练瓶颈解耦。
- 3D 高斯分布以二维图像结构存储,使模型能够使用高效的 2D 卷积操作,而非昂贵的 3D 运算,从而简化训练与推理过程。
- 对于多视角输入,该方法通过将预测结果注册到统一参考帧,并注入轻量级跨视角注意力模块,实现多视角特征融合。
- 模型通过结合 L1 损失、LPIPS 损失与感知损失进行训练,每个训练迭代均生成完整的 360° 渲染视图,以优化视觉真实感。
- 后处理包括剔除不活跃的高斯分布(不透明度 ≈ 0),在不损失质量的前提下降低内存占用与渲染开销。

实验结果
研究问题
- RQ1能否通过简单的 2D 网络将高斯点阵有效适配于单目 3D 重建,以预测 3D 高斯分布?
- RQ2通过 2D 图像到图像网络映射至 3D 高斯混合分布,是否能实现从单视角出发的高保真 360° 重建?
- RQ3该方法是否能在保持极低推理与训练延迟的同时,实现最先进水平的重建质量?
- RQ4与部分视图监督相比,使用感知损失(如 LPIPS)并结合全视角渲染,是否能显著提升模型泛化能力?
- RQ5在不依赖绝对相机位姿的前提下,多视角注意力机制在融合多张输入图像预测结果时,能在多大程度上提升重建质量?
主要发现
- Splatter Image 在单张 GPU 上实现 38 FPS 推理速度,测试阶段效率比 PixelNeRF 和 VisionNeRF 快超过 1000 倍。
- 该方法在单张 A6000 GPU 上仅用 7 天即可高效训练,在 ShapeNet 与 CO3D 基准测试中达到最先进 PSNR 与 LPIPS 指标,优于 VisionNeRF(后者需 16 张 A100 GPU 训练 5 天)。
- 在 ShapeNet-SRN 基准测试中,Splatter Image 实现 PSNR 28.98 与 LPIPS 0.033,优于 PixelNeRF(PSNR 28.45,LPIPS 0.037)与 VisionNeRF(PSNR 28.71,LPIPS 0.037),且延迟显著更低。
- 该方法在未见视图上泛化能力出色:尽管推理时仅输入单侧视角,模型仍能以高保真度重建完整的 360° 对象,得益于训练过程中强归纳偏置。
- 后处理中超过 50% 的高斯分布为不活跃状态(不透明度 ≈ 0),可高效剔除而不损失质量,显著提升渲染速度与内存效率。
- 该方法无需规范或绝对相机位姿,仅依赖相对位姿,简化了部署流程,并增强了对位姿变化的鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。