Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Discovery and Composition of Object Light Fields

Cameron M. Smith, Hong-Xing Yu|arXiv (Cornell University)|May 8, 2022
Advanced Vision and Imaging被引用 6
一句话总结

本文提出组合式物体光场(COLF),一种新颖的方法,利用神经光场实现无监督发现与渲染三维以物体为中心的场景。通过用可学习的光场合成模块替代昂贵的体素渲染,COLF 在推理和训练速度上实现了数量级的提升,同时保持了最先进的重建与新视角合成性能,实现了对包含数十个物体的场景的实时渲染。

ABSTRACT

Neural scene representations, both continuous and discrete, have recently emerged as a powerful new paradigm for 3D scene understanding. Recent efforts have tackled unsupervised discovery of object-centric neural scene representations. However, the high cost of ray-marching, exacerbated by the fact that each object representation has to be ray-marched separately, leads to insufficiently sampled radiance fields and thus, noisy renderings, poor framerates, and high memory and time complexity during training and rendering. Here, we propose to represent objects in an object-centric, compositional scene representation as light fields. We propose a novel light field compositor module that enables reconstructing the global light field from a set of object-centric light fields. Dubbed Compositional Object Light Fields (COLF), our method enables unsupervised learning of object-centric neural scene representations, state-of-the-art reconstruction and novel view synthesis performance on standard datasets, and rendering and training speeds at orders of magnitude faster than existing 3D approaches.

研究动机与目标

  • 解决以物体为中心的神经辐射场中体素渲染的高计算成本问题,该问题限制了可扩展性和渲染质量。
  • 克服由于射线查询中深度顺序未知而导致的部分光场非解析合成的挑战。
  • 从二维图像中无监督地发现以物体为中心的三维表示,提升泛化能力与渲染效率。
  • 在保持或提升重建保真度的同时,实现与先前最先进方法相当或更优的实时渲染与训练速度。

提出的方法

  • 将场景中的每个物体表示为神经光场,其中每条射线在每个物体上仅采样一次,与体素渲染相比显著降低了每条射线的计算量。
  • 引入一个可学习的光场合成模块,基于射线的深度顺序估计每个物体光场的软可见性权重,实现对以物体为中心的光场进行可微分的组合,生成全局场景光场。
  • 使用槽注意力机制从二维图像中推断物体编码,随后用于查询每个物体光场网络的颜色和深度排序特征。
  • 使用可微分渲染目标端到端训练模型,最小化预测图像与真实图像之间的像素级重建损失。
  • 在光场网络中引入周期性激活函数和傅里叶特征,以提升表示能力与渲染质量。
  • 通过变换以物体为中心的光场坐标,实现场景编辑,支持在不重新训练的情况下实现物体在不同场景间的平移与组合。

实验结果

研究问题

  • RQ1神经光场能否以一种高效且可微分的方式表示以物体为中心的三维场景,而无需显式深度排序?
  • RQ2可学习的合成模块能否有效估计重叠物体光场的软可见性,从而实现准确的全局光场重建?
  • RQ3用单次采样光场渲染替代体素渲染是否能实现显著的速度提升,同时保持或改善重建质量?
  • RQ4所提出的方法能否泛化到训练时未见的更多物体的场景,特别是在复杂、杂乱的环境中?
  • RQ5该模型在多大程度上能够支持对包含数十个物体的无界场景实现实时交互式编辑与组合?

主要发现

  • COLF 在标准基准测试中实现了最先进的新视角合成性能,在 CLEVR-11 数据集上的 LPIPS 得分为 0.1128,优于 uORF(0.1540)和 NeRF-AE(0.2201)。
  • 与基于体素渲染的方法相比,该方法实现了两个数量级更快的训练和推理速度,支持最多 20 个物体的场景实现实时渲染。
  • COLF 在 11 个物体的场景中表现出良好的泛化能力,超过训练时的 7 个物体限制,并在分割和视角合成任务中均保持了优异性能。
  • 该模型成功将复杂场景(如街区场景)分解为背景和前景汽车光场,实现了精确的编辑与组合。
  • 光场合成模块有效处理了未知的深度顺序问题,实现了对以物体为中心的光场的可微分且稳定的组合。
  • 补充结果表明,使用先前基于体素渲染的基线方法渲染相同场景将需要难以承受的高计算成本,凸显了 COLF 的效率优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。