[论文解读] SinNeRF: Training Neural Radiance Fields on Complex Scenes from a Single Image
SinNeRF 提出了一种半监督框架,通过利用几何和语义伪标签,在复杂场景中仅用单张图像训练神经辐射场(NeRF),以实现多视角一致性与感知质量。该方法在无需多视角监督或大规模数据集预训练的情况下,实现了最先进(SOTA)的新型视角合成效果。
Despite the rapid development of Neural Radiance Field (NeRF), the necessity of dense covers largely prohibits its wider applications. While several recent works have attempted to address this issue, they either operate with sparse views (yet still, a few of them) or on simple objects/scenes. In this work, we consider a more ambitious task: training neural radiance field, over realistically complex visual scenes, by "looking only once", i.e., using only a single view. To attain this goal, we present a Single View NeRF (SinNeRF) framework consisting of thoughtfully designed semantic and geometry regularizations. Specifically, SinNeRF constructs a semi-supervised learning process, where we introduce and propagate geometry pseudo labels and semantic pseudo labels to guide the progressive training process. Extensive experiments are conducted on complex scene benchmarks, including NeRF synthetic dataset, Local Light Field Fusion dataset, and DTU dataset. We show that even without pre-training on multi-view datasets, SinNeRF can yield photo-realistic novel-view synthesis results. Under the single image setting, SinNeRF significantly outperforms the current state-of-the-art NeRF baselines in all cases. Project page: https://vita-group.github.io/SinNeRF/
研究动机与目标
- 在仅使用单张参考图像的前提下,实现复杂场景中神经辐射场(NeRF)的训练,克服对密集多视角覆盖的需求。
- 解决从单张图像进行三维几何重建与视角合成的挑战,此前置方法因缺乏深度与结构先验而失效。
- 开发一种半监督训练策略,利用伪标签稳定并引导训练过程,以应对缺乏多视角监督的问题。
- 在不依赖大规模多视角数据集预训练或专用网络架构的前提下,实现照片级真实感的新型视角合成。
提出的方法
- 提出一种半监督训练框架,通过在参考视图与未见视图之间进行图像扭曲,生成并传播几何伪标签,以确保多视角几何一致性。
- 采用判别器与预训练的视觉Transformer(ViT)生成语义伪标签,以指导未见视图中的局部纹理质量与全局结构保真度。
- 采用多损失训练目标,结合几何监督、用于局部纹理真实感的对抗损失,以及来自DINO-ViT的[CLS]标记对比损失,以实现全局语义一致性。
- 仅在参考视图上应用深度监督,同时利用伪标签的几何与语义先验,在训练过程中正则化未见视图。
- 利用图像扭曲技术将深度从参考视图重投影到未见视图,实现在无显式多视角监督下的跨视图一致3D几何。
- 采用渐进式训练策略,迭代优化并传播伪标签,以提升泛化能力并减少模式崩溃。
实验结果
研究问题
- RQ1在缺乏多视角监督的情况下,能否有效从单张图像在复杂场景中训练神经辐射场?
- RQ2如何从单张图像合成几何与语义先验,以稳定NeRF的训练过程?
- RQ3几何伪标签与语义伪标签在提升新型视角合成质量方面的相对贡献如何?
- RQ4具有伪标签的半监督框架是否能超越现有最先进(SOTA)方法在单图像NeRF训练中的表现?
主要发现
- SinNeRF 在复杂场景基准测试中达到最先进性能,包括NeRF合成数据集、LLFF和DTU数据集,且无需在多视角数据上进行预训练。
- 在DTU数据集上,SinNeRF 的PSNR为20.97,SSIM为0.82,LPIPS为0.0932,定量与定性结果均优于DS-NeRF、PixelNeRF与DietNeRF。
- 消融实验表明,若移除几何伪标签,将导致显著的几何误差;若移除语义伪标签,则产生结构伪影与错误的全局布局。
- 使用DINO-ViT的[CLS]标记作为全局结构先验,相比基于VGG的特征、风格或自相似性损失,性能更优,证明其对像素错位具有更强鲁棒性。
- 无对抗训练的变体出现模糊伪影,证实判别器在提供局部纹理引导方面的重要性。
- 完整模型(包含所有组件)表现最佳,相比无全局结构先验的变体提升2.77 PSNR,相比基线模型LPIPS降低0.0987。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。