Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Infer 3D Object Models from Images.

Chang Chen, Fei Deng|arXiv (Cornell University)|Jun 11, 2020
Robotics and Sensor-Based Localization参考文献 26被引用数 5
ひとこと要約

本稿では、複数のオブジェクトを含むシーン画像から、同時にオブジェクト領域を探索・グループ化することで、3Dオブジェクト表現を無教師で推論する、エンドツーエンドの確率的生成モデルを提案する。このモデルは、合成レンダリングを用いて個々のオブジェクトおよび全体のシーンの新規ビュー合成を可能にし、教師なしで分離可能でモジュラーな3Dオブジェクトモデリングを達成する。

ABSTRACT

A crucial ability of human intelligence is to build up models of individual 3D objects from partial scene observations. Recent works have enabled unsupervised 3D representation learning at scene-level, yet learning to decompose the 3D scene into 3D objects and build their individual models from multi-object scene images remains elusive. In this paper, we propose a probabilistic generative model for learning to build modular and compositional 3D object models from observations of a multi-object scene. The proposed model can (i) infer the 3D object representations by learning to search and group object areas and also (ii) render from an arbitrary viewpoint not only individual objects but also the full scene by compositing the objects. The entire learning process is unsupervised and end-to-end. We also demonstrate that the learned representation permits object-wise manipulation and novel scene generation, and generalizes to various settings.

研究の動機と目的

  • 複数オブジェクトを含むシーン画像から、シーンレベルの3D表現学習における制限を克服して、教師なしで3Dオブジェクトモデルを学習すること。
  • オブジェクトのモジュラーかつ合成的な表現を推論することで、複雑なシーンを個々の3Dオブジェクトに分解すること。
  • 個々のオブジェクトの合成による、個々のオブジェクトおよび全体のシーンの新規ビュー合成を支援すること。
  • アノテートされた3Dオブジェクトインスタンスやオブジェクトレベルの教師信号を一切使用せず、エンドツーエンドの自己教師学習を実現すること。
  • 学習済み表現を活用して、オブジェクト単位での操作や新規シーン生成といった後続の機能を可能にすること。

提案手法

  • モデルは、シーン内のオブジェクトの位置、3D形状、外観を同時に推論する確率的生成フレームワークを採用する。
  • 異なる微分可能レンダリング機構を用いて、個々の3Dオブジェクト予測を合成し、全体のシーンビューを生成することで、監視信号を提供する。
  • オブジェクトの推論は、2D画像観測から3Dオブジェクト領域を同定・分離するための探索・グループ化プロセスによって実現される。
  • 構造的ラティント変数空間を用いることで、オブジェクトの識別子と空間的配置を分離して学習する。
  • 訓練は完全に教師なしであり、レンダリングされたビューからのピixe レベル再構成損失を最適化することで、生成プロセスを最適化する。
  • 異なる微分可能レンダリングを用いて、学習済みの3Dオブジェクトモデルを合成することで、任意の視点のレンダリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ13Dの教師信号やオブジェクトレベルのアノテーションが一切ない状態で、複数オブジェクトを含むシーン画像から3Dオブジェクト表現を推論できるか?
  • RQ2モデルは、シーン内のオブジェクト領域を発見・グループ化し、モジュラーな3Dオブジェクトモデルを形成できるか?
  • RQ3学習された3D表現は、個々のオブジェクトおよび全体のシーンの高精度な新規ビュー合成を可能にするか?
  • RQ4モデルは多様なシーン構成に一般化可能であり、オブジェクト単位での操作やシーン生成を可能にするか?
  • RQ5エンドツーエンドの教師なし学習を実現しつつ、分離可能で解釈可能な3Dオブジェクト表現を維持できるか?

主な発見

  • モデルは、完全に教師なしの状態で、複数オブジェクトを含むシーンから3Dオブジェクト表現を効果的に推論できる。
  • 推論された3Dオブジェクトモデルは、個々のオブジェクトおよび完全なシーンの高品質な新規ビュー合成を可能にする。
  • 表現は、シーン内のオブジェクトの再配置や交換といったオブジェクト単位での操作を可能にする。
  • 微調整なしに、多様なシーンレイアウトやオブジェクト構成に一般化する。
  • 3Dアノテーションを一切使用しないにもかかわらず、教師ありベースラインと比較して、3D再構成およびビュー合成の面で競争力のある性能を達成する。
  • 分離された3D表現により、学習済みのオブジェクトモデルを合成することで意味のあるシーン生成が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。