[论文解读] PANeRF: Pseudo-view Augmentation for Improved Neural Radiance Fields Based on Few-shot Inputs
PANeRF 提出了一种伪视图增强(PA)方案,通过从少样本输入中合成几何上合理的新型视图来提升 NeRF 训练效果。通过利用 DINO-ViT 的显著性图分离前景与背景区域,该方法生成可靠的伪视图用于初始训练,随后采用两阶段微调策略,结合多级语义一致性(MSC)与信息潜能(IP)正则化,即使在单视图输入下也实现了最先进的视图合成质量。
The method of neural radiance fields (NeRF) has been developed in recent years, and this technology has promising applications for synthesizing novel views of complex scenes. However, NeRF requires dense input views, typically numbering in the hundreds, for generating high-quality images. With a decrease in the number of input views, the rendering quality of NeRF for unseen viewpoints tends to degenerate drastically. To overcome this challenge, we propose pseudo-view augmentation of NeRF, a scheme that expands a sufficient amount of data by considering the geometry of few-shot inputs. We first initialized the NeRF network by leveraging the expanded pseudo-views, which efficiently minimizes uncertainty when rendering unseen views. Subsequently, we fine-tuned the network by utilizing sparse-view inputs containing precise geometry and color information. Through experiments under various settings, we verified that our model faithfully synthesizes novel-view images of superior quality and outperforms existing methods for multi-view datasets.
研究动机与目标
- 为解决在输入视图稀疏时 NeRF 渲染质量下降的问题,尤其是在增强现实/虚拟现实(AR/VR)与自动驾驶等实际应用中。
- 克服现有少样本 NeRF 方法在未见视点中因几何不准确、漂浮伪影及细节丢失而带来的局限性。
- 在极端数据稀缺(如单视图输入)条件下提升 NeRF 优化的泛化能力并减少不确定性。
- 开发一种鲁棒的训练流程,结合数据增强与语义感知正则化,实现更优的视图合成效果。
提出的方法
- 伪视图增强(PA)通过使用深度图对输入图像进行扭曲,生成合成视图,扩展原始输入视图周围的训练数据分布。
- 利用 DINO-ViT 的显著性图对前景与背景区域进行分割,实现区域级损失计算,以降低扭曲伪影的影响。
- 采用两阶段训练流程:首先在所有增强的伪视图上对 NeRF 进行预训练,以减少新型视图预测中的不确定性。
- 随后使用真实稀疏视图对网络进行微调,并引入两种新型正则化损失:多级语义一致性(MSC)与信息潜能(IP)。
- MSC 在局部与全局层面强制保持语义一致性,确保视图间结构与语义保真度。
- IP 通过鼓励沿射线的辐射度预测一致性,最小化不确定性,尤其在数据稀疏条件下表现优异。
实验结果
研究问题
- RQ1在仅使用单个输入视图进行训练时,伪视图增强是否能显著提升 NeRF 性能?
- RQ2在存在扭曲伪影的情况下,使用显著性图进行区域级损失计算在多大程度上提升了伪视图训练的可靠性?
- RQ3所提出的 MSC 与 IP 正则化器在多大程度上减少了不确定性,并提升了新型视图合成中的几何与语义保真度?
- RQ4在多种数据集与设置下,PANeRF 与现有少样本 NeRF 方法相比,在 PSNR、SSIM 与 LPIPS 指标上的表现如何?
主要发现
- 在 DTU 数据集上使用 1 视图输入时,PANeRF 达到 PSNR 22.82,显著优于基线 NeRF(20.07)及其他 SOTA 方法。
- 在 Realistic Synthetic 360° 数据集的窄基线设置下,PANeRF 实现 PSNR 21.50 与 LPIPS 0.156,优于 InfoNeRF(PSNR 18.41,LPIPS 0.199)。
- 消融实验表明,结合 PA 与 MSC 及 IP 正则化可获得最高 PSNR(22.82)与最低 LPIPS(0.144),证明了协同增益效果。
- MSC 损失优于先前工作的 SC 损失,视觉上证实其能生成更清晰的细节与更优的语义一致性,如图 6 放大区域所示。
- 该方法在多个数据集与设置下表现出强鲁棒性,包括极端情况如单视图与窄基线输入,始终保持高质量的视图合成效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。