Skip to main content
QUICK REVIEW

[论文解读] Learning to Infer 3D Object Models from Images.

Chang Chen, Fei Deng|arXiv (Cornell University)|Jun 11, 2020
Robotics and Sensor-Based Localization参考文献 26被引用 5
一句话总结

该论文提出了一种无监督、端到端的概率生成模型,通过联合搜索和分组物体区域,从多物体场景图像中学习推断3D物体表征。该模型通过组合式渲染实现对单个物体和完整场景的新视角合成,实现了无监督的解耦、模块化3D物体建模。

ABSTRACT

A crucial ability of human intelligence is to build up models of individual 3D objects from partial scene observations. Recent works have enabled unsupervised 3D representation learning at scene-level, yet learning to decompose the 3D scene into 3D objects and build their individual models from multi-object scene images remains elusive. In this paper, we propose a probabilistic generative model for learning to build modular and compositional 3D object models from observations of a multi-object scene. The proposed model can (i) infer the 3D object representations by learning to search and group object areas and also (ii) render from an arbitrary viewpoint not only individual objects but also the full scene by compositing the objects. The entire learning process is unsupervised and end-to-end. We also demonstrate that the learned representation permits object-wise manipulation and novel scene generation, and generalizes to various settings.

研究动机与目标

  • 从多物体场景图像中实现无监督学习3D物体模型,克服场景级3D表征学习的局限性。
  • 通过推断其模块化和组合式表征,将复杂场景分解为单个3D物体。
  • 通过基于物体的组合方式,支持对单个物体和完整场景的新视角合成。
  • 实现端到端、自监督训练,无需标注的3D物体实例或物体级监督。
  • 支持下游能力,如基于学习表征的物体级操作和新场景生成。

提出的方法

  • 该模型采用概率生成框架,联合推理场景中物体的位置、3D形状和外观。
  • 它使用可微分渲染机制,将单个3D物体预测组合成完整场景视图以提供监督。
  • 通过一种搜索与分组过程实现物体推理,从2D图像观测中识别并分割3D物体区域。
  • 模型通过结构化潜在变量空间学习解耦物体身份与空间布局。
  • 训练完全无监督,利用渲染视图的像素级重建损失来优化生成过程。
  • 该框架通过组合学习到的3D物体模型与可微分渲染,支持任意视角渲染。

实验结果

研究问题

  • RQ1模型能否在无任何3D监督或物体级标注的情况下,从未知的多物体场景图像中推断3D物体表征?
  • RQ2模型能否在场景中发现并分组物体区域,形成模块化的3D物体模型?
  • RQ3学习到的3D表征能否支持对单个物体和完整场景的高精度新视角合成?
  • RQ4模型能否泛化到多样的场景配置,并支持基于物体的操作与场景生成?
  • RQ5模型能否在保持解耦且可解释的3D物体表征的同时,实现端到端的无监督训练?

主要发现

  • 该模型成功在完全无监督的情况下,从多物体场景中推断出3D物体表征。
  • 推断出的3D物体表征支持对单个物体和完整场景的高质量新视角合成。
  • 该表征支持物体级操作,如在场景中重新定位或替换物体。
  • 该模型在无需微调的情况下,泛化到多样的场景布局和物体配置。
  • 尽管未使用任何3D标注,该方法在3D重建和视角合成方面与有监督基线相比表现具有竞争力。
  • 解耦的3D表征使得通过组合学习到的物体模型实现有意义的场景生成成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。