[论文解读] FSGS: Real-Time Few-shot View Synthesis using Gaussian Splatting
FSGS 提出了一种基于 3D 高斯溅射的实时少样本新视角合成框架,仅需三张图像即可实现照片级渲染效果。该方法引入了基于邻近度的高斯反池化机制,以密集化稀疏的 SfM 点云,并通过在线增强的伪视图整合单目深度先验,实现在移动设备采集数据集上的 203 FPS 推理速度,PSNR 达到 19.54(SOTA),SSIM 达到 0.539。
Novel view synthesis from limited observations remains an important and persistent task. However, high efficiency in existing NeRF-based few-shot view synthesis is often compromised to obtain an accurate 3D representation. To address this challenge, we propose a few-shot view synthesis framework based on 3D Gaussian Splatting that enables real-time and photo-realistic view synthesis with as few as three training views. The proposed method, dubbed FSGS, handles the extremely sparse initialized SfM points with a thoughtfully designed Gaussian Unpooling process. Our method iteratively distributes new Gaussians around the most representative locations, subsequently infilling local details in vacant areas. We also integrate a large-scale pre-trained monocular depth estimator within the Gaussians optimization process, leveraging online augmented views to guide the geometric optimization towards an optimal solution. Starting from sparse points observed from limited input viewpoints, our FSGS can accurately grow into unseen regions, comprehensively covering the scene and boosting the rendering quality of novel views. Overall, FSGS achieves state-of-the-art performance in both accuracy and rendering efficiency across diverse datasets, including LLFF, Mip-NeRF360, and Blender. Project website: https://zehaozhu.github.io/FSGS/.
研究动机与目标
- 为解决从极少数输入视角(最少三张)实现高保真、实时新视角合成的挑战。
- 克服现有基于 NeRF 的方法在少样本设置下仍存在高训练与渲染成本的问题。
- 在稀疏初始化场景中,利用 3D 高斯分布提升几何精度与场景覆盖范围。
- 在优化过程中有效利用单目深度先验,以指导几何一致性并减少过拟合。
- 实现在移动 VR/AR 与自主系统等实际应用场景中的可部署性。
提出的方法
- 提出基于邻近度的高斯反池化机制,通过在靠近已有高斯点的代表性位置添加新高斯点,迭代式地增强 3D 高斯点云的密度。
- 引入可微分的深度光栅化器,将预训练单目深度估计器的深度先验信息反向传播至高斯优化过程。
- 利用在线生成的伪视图增强深度监督,并在训练过程中提升几何正则化效果。
- 结合光度损失与深度相关性(皮尔逊相关系数)的多目标损失函数,以平衡外观与几何的一致性。
- 采用基于不透明度与邻近度阈值的动态优化策略,实现自适应的高斯点密度增强与剪枝。
- 使用 COLMAP 进行初始 SfM 重建,并利用预训练深度模型为真实视图与伪视图输入生成深度先验。

实验结果
研究问题
- RQ1基于 3D 高斯溅射的框架能否在保持高视觉保真度的同时实现新视角合成的实时渲染?
- RQ2如何在不过拟合的前提下,有效增强稀疏初始 SfM 点云的密度,以覆盖未观测区域?
- RQ3在低视角数量场景下,单目深度先验能在多大程度上提升几何精度与泛化能力?
- RQ4在缺乏多视角监督的情况下,在线伪视图增强是否能有效提升 3D 高斯点的优化效果?
- RQ5在真实世界移动设备采集的数据上,该方法在渲染质量与速度方面相较于 SOTA 的 NeRF 与 3D-GS 基线方法表现如何?
主要发现
- FSGS 实现了 203 FPS 的渲染速度,相比 SparseNeRF 提升了 2900 倍,可在消费级硬件上实现实时推理。
- 在仅使用三张训练图像的移动设备采集数据集上,FSGS 的 PSNR 达到 19.54,SSIM 达到 0.539,两项指标均优于所有基线方法。
- 与 SparseNeRF 相比,SSIM 从 0.684 提升至 0.745,显著提升了视觉质量。
- FSGS 生成的深度图更清晰,几何细节更丰富,而 3D-GS 常在远距离区域产生过度平滑现象。
- 通过伪视图引入的深度先验显著减少了混叠伪影,提升了未观测区域的几何连续性。
- 在深度质量方面,FSGS 优于 FreeNeRF 与 SparseNeRF,伪影更少,且对复杂场景结构的重建更完整。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。