[论文解读] Learning Neural Light Fields with Ray-Space Embedding Networks
本文提出了一种基于射线空间嵌入网络的新型神经光场表示方法,该方法将4D射线空间映射到可插值的潜在空间,实现仅需每个像素一次或少数几次网络评估的快速、内存高效的视图合成。该方法在斯坦福光场等密集前向视角数据集上实现了最先进性能,相较于基于NeRF的方法,在速度、质量及内存效率方面表现更优,尤其在处理反射和折射等复杂视角依赖效应时优势显著。
Neural radiance fields (NeRFs) produce state-of-the-art view synthesis results. However, they are slow to render, requiring hundreds of network evaluations per pixel to approximate a volume rendering integral. Baking NeRFs into explicit data structures enables efficient rendering, but results in a large increase in memory footprint and, in many cases, a quality reduction. In this paper, we propose a novel neural light field representation that, in contrast, is compact and directly predicts integrated radiance along rays. Our method supports rendering with a single network evaluation per pixel for small baseline light field datasets and can also be applied to larger baselines with only a few evaluations per pixel. At the core of our approach is a ray-space embedding network that maps the 4D ray-space manifold into an intermediate, interpolable latent space. Our method achieves state-of-the-art quality on dense forward-facing datasets such as the Stanford Light Field dataset. In addition, for forward-facing scenes with sparser inputs we achieve results that are competitive with NeRF-based approaches in terms of quality while providing a better speed/quality/memory trade-off with far fewer network evaluations.
研究动机与目标
- 为解决NeRF在渲染速度和内存使用方面的局限性,通过学习神经光场表示来实现改进。
- 实现对密集和稀疏输入光场的高效且高质量的视图合成。
- 对反射和折射等复杂视角依赖效应进行建模,这些效应在体素表示中难以准确捕捉。
- 在渲染速度、内存占用和重建质量之间实现优于现有方法的平衡。
- 开发一种可学习、可微分的表示方法,支持从部分观测中实现4D射线空间的精确插值。
提出的方法
- 射线空间嵌入网络将4D射线参数(如双平面参数化)映射到可学习、可插值的潜在空间,以提升泛化能力和插值性能。
- 采用多分辨率体素网格将空间划分为局部光场,从而在保持快速推理的同时更好地建模稀疏输入。
- 引入局部仿射变换嵌入,以隐式方式鼓励局部颜色等高线呈线性,提升插值过程中的视图一致性。
- 通过体积渲染损失进行网络训练,最小化预测视图与真实视图之间的像素级差异。
- 对射线坐标应用位置编码,以增强嵌入网络的表示能力。
- 该方法支持在小基线光场中每个像素仅一次网络评估即可完成渲染,在较大基线情况下也仅需少数评估。
实验结果
研究问题
- RQ1能否在4D射线空间上直接学习神经表示,以实现快速且准确的视图合成?
- RQ2如何在神经光场中忠实建模反射和折射等复杂视角依赖效应?
- RQ3与直接的NeRF风格5D辐射场学习相比,可学习的嵌入网络是否能提升射线空间中的插值质量?
- RQ4在神经光场中使用空间划分时,渲染速度、内存使用与重建质量之间的权衡如何?
- RQ5所提出方法是否能在速度、质量与内存效率方面超越基于NeRF和显式网格的方法?
主要发现
- 在斯坦福光场数据集上,所提方法的PSNR达到27.454,SSIM为0.905,相较于NeRF(PSNR: 27.928,SSIM: 0.916)在速度和内存效率方面表现更优。
- 在稀疏前向视角场景中,使用16³网格时,该方法实现PSNR为27.350,帧率为0.69 FPS,优于AutoInt(PSNR: 25.531,帧率0.26 FPS)在相近分辨率下的表现。
- 消融实验表明,局部仿射嵌入在插值质量上优于基线和基于特征的嵌入方法,实现了视图一致性最佳的权衡。
- 在32³划分下,该方法将渲染时间降低至0.34 FPS,同时保持高质量(PSNR: 27.454),而NeRF仅为0.07 FPS。
- 在复杂视角依赖效应(如扭曲的反射和折射)上,该模型取得了具有竞争力的结果,而标准NeRF对此类效应建模效果较差。
- 初步实验在360°场景中使用普吕克坐标显示,该方法优于AutoInt,尽管此时颜色等高线不再保持仿射性,表明仍有进一步改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。