Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Discovery of Object Radiance Fields

Hong-Xing Yu, Leonidas Guibas|arXiv (Cornell University)|Jul 16, 2021
Generative Adversarial Networks and Image Synthesis参考文献 66被引用 19
一句话总结

本文提出无监督对象辐射场(uORF),一种仅使用多视角RGB图像作为输入,从单张图像中学习3D感知、以物体为中心的场景表征的方法。通过将条件NeRF与深度推理网络结合,并采用自粗至精的训练策略,uORF在无监督3D场景分解任务中达到最先进性能,支持新型3D场景编辑任务,并能泛化至未见过的物体排列与外观。

ABSTRACT

We study the problem of inferring an object-centric scene representation from a single image, aiming to derive a representation that explains the image formation process, captures the scene's 3D nature, and is learned without supervision. Most existing methods on scene decomposition lack one or more of these characteristics, due to the fundamental challenge in integrating the complex 3D-to-2D image formation process into powerful inference schemes like deep networks. In this paper, we propose unsupervised discovery of Object Radiance Fields (uORF), integrating recent progresses in neural 3D scene representations and rendering with deep inference networks for unsupervised 3D scene decomposition. Trained on multi-view RGB images without annotations, uORF learns to decompose complex scenes with diverse, textured background from a single image. We show that uORF enables novel tasks, such as scene segmentation and editing in 3D, and it performs well on these tasks and on novel view synthesis on three datasets.

研究动机与目标

  • 开发一种无监督方法,从单张图像中学习解耦的、3D感知的、生成式的场景表征。
  • 解决在无监督条件下将复杂3D到2D图像形成过程与深度学习相结合的挑战。
  • 实现场景无3D标注或类别特定监督下的3D场景分解为物体与背景。
  • 支持新型3D场景编辑任务,并能泛化至未见过的物体排列与外观。
  • 通过渐进式的自粗至精训练策略提升神经渲染的计算效率。

提出的方法

  • uORF使用神经隐式表征将3D场景建模为单个物体辐射场与背景辐射场的组合。
  • 它采用可微分体素渲染从推断出的辐射场中渲染新视角,并以像素空间中的重建损失作为监督信号。
  • 该方法提出一种新颖的渐进式自粗至精训练调度策略,在降低计算成本的同时提升表征质量。
  • 通过显式分离建模背景几何与外观,提升在具有多样化背景的复杂场景中的学习效果。
  • 引入感知损失与对抗性损失,以增强单图像3D推理中的图像保真度与鲁棒性。
  • 框架利用条件NeRF实现从单张输入图像中解耦推理出特定物体的辐射场。

实验结果

研究问题

  • RQ1深度生成模型能否在无任何3D监督的情况下,从单张图像中推断出3D感知、以物体为中心的场景表征?
  • RQ2该方法能否泛化至未见过的物体空间排列,如密集堆叠的场景?
  • RQ3该模型能否泛化至训练期间未见过的形状与颜色组合?
  • RQ4所提出的自粗至精训练策略在计算成本与重建质量之间是否具有良好的平衡效果?
  • RQ5推断出的辐射场能否支持新型3D场景编辑任务,如物体重定位与背景替换?

主要发现

  • 在Room-Diverse数据集上,uORF的3D分割ARI得分为87.4 ± 0.4,显著优于基线方法。
  • 在包含11个紧密堆叠物体的packed-CLEVR-11基准上,uORF取得85.0 ± 0.3的NV-ARI,展现出对复杂空间排列的强大泛化能力。
  • uORF可泛化至未见过的形状与颜色组合,在仅包含红色圆柱与蓝色球体的测试集上达到87.4 ± 0.4的ARI,与在相同分布上训练的最优模型(oracle model)性能相当。
  • 消融实验表明,结合重建损失、感知损失与对抗性损失可获得最佳图像质量,将LPIPS降低至0.1729。
  • uORF生成的新视角具有极少伪影且保真度高,在定量与定性评估中均优于NeRF-AE与Slot Attention。
  • 由于显式背景建模与解耦的辐射场设计,该方法支持实用的3D场景编辑,如独立移动物体与修改背景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。