Skip to main content
QUICK REVIEW

[論文レビュー] ROOTS: Object-Centric Representation and Rendering of 3D Scenes

Chang Chen, Feiqi Deng|arXiv (Cornell University)|Jun 11, 2020
Robotics and Sensor-Based Localization被引用数 13
ひとこと要約

ROOTSは、部分観測からオブジェクト中心の3次元シーン表現を推論し、それらを合成することで新規ビュー合成を実現する、教師なしでエンドツーエンド微分可能な生成モデルを提案する。ネストドオートエンコーダアーキテクチャを用い、内部モジュールにGQNを採用することで、オブジェクトの構造を個別に推論し、オブジェクトの配置や形状を組み合わせることで、3次元シーン生成、オブジェクト単位での操作、未学習のオブジェクト数への一般化において最先端の性能を達成する。

ABSTRACT

A crucial ability of human intelligence is to build up models of individual 3D objects from partial scene observations. Recent works achieve object-centric generation but without the ability to infer the representation, or achieve 3D scene representation learning but without object-centric compositionality. Therefore, learning to represent and render 3D scenes with object-centric compositionality remains elusive. In this paper, we propose a probabilistic generative model for learning to build modular and compositional 3D object models from partial observations of a multi-object scene. The proposed model can (i) infer the 3D object representations by learning to search and group object areas and also (ii) render from an arbitrary viewpoint not only individual objects but also the full scene by compositing the objects. The entire learning process is unsupervised and end-to-end. In experiments, in addition to generation quality, we also demonstrate that the learned representation permits object-wise manipulation and novel scene generation, and generalizes to various settings. Results can be found on our project website: https://sites.google.com/view/roots3d

研究の動機と目的

  • 部分観測からのオブジェクト中心の分解を可能にする、教師なし3次元シーン表現学習のギャップを埋める。
  • 任意の視点からレンダリング可能な3次元オブジェクト表現を推論し、それらを合成するモデルを開発する。
  • オブジェクトの識別やレイアウトに関する教師信号なしに、モジュラーで構成的な3次元表現をエンドツーエンドで教師なしに学習する。
  • 分離されたオブジェクトレベル表現を活用することで、オブジェクト操作や新規シーン生成などの下流タスクを可能にする。
  • 学習時に見なかったオブジェクト数の多いシーンにも一般化できることを示す、体系的な一般化能力を実現する。

提案手法

  • ROOTSは、部分的なシーン観測からオブジェクト領域を識別・グループ化するための微分可能なアテンション機構を用いた階層的生成モデルを採用する。
  • 内部オートエンコーダが事前学習済みのGQNモデルであるネストドオートエンコーダアーキテクチャを採用し、オブジェクトレベルでの3次元に適応した表現学習を可能にする。
  • オブジェクトレベルの3次元表現は変分推論により学習され、潜在変数が各オブジェクトの外観と3次元ジオメトリを同時に符号化する。
  • 個々のオブジェクトのレンダリングを、推論された3次元位置とアングルに基づいて合成することで、任意の視点からの新規ビュー合成を実現する。
  • オブジェクト関係の分類にはグラフネットワークを用い、下流タスク(オブジェクト検索やペア分類など)のための共有分類ヘッドを搭載する。
  • 訓練は完全に教師なしで、負の対数尤度(NLL)損失とKL正則化のスケジューリングを用い、学習の安定化を図る。

実験結果

リサーチクエスチョン

  • RQ1教師なしで、部分的な3次元シーン観測からモジュラーでオブジェクト中心の3次元表現を推論できるか?
  • RQ2推論されたオブジェクトレベル表現は、個々のオブジェクトおよび全体のシーンに対する正確で一般化可能な新規ビュー合成を可能にするか?
  • RQ3モデルは分離されたオブジェクト単位での操作と、学習時とは異なるオブジェクト数のシーンへの体系的一般化を可能にするか?
  • RQ4構造の正確性と下流タスクのパフォーマンスの観点から、シーンレベルの表現と比較してオブジェクト中心の3次元表現は優れているか?
  • RQ5モデルは学習分布外の多様なシーン構成やオブジェクト配置にも一般化できるか?

主な発見

  • シミュレーテッド3次元シーンにおいて、CGQNやIODINEベースラインと比較して低い負の対数尤度(NLL)を達成し、生成品質が最先端である。
  • モデルはオブジェクト単位での操作や最大10個のオブジェクトを含む新規シーン生成が可能な、分離された3次元オブジェクト表現を学習している。これは学習時の3〜5個のオブジェクトを上回る。
  • Retrieve ObjectおよびFind Pairの下流タスクにおいて、Multi-Shepard-Metzlerデータセットでそれぞれ85.6%および74.3%の精度を達成し、CGQNおよびIODINEを上回った。
  • 未学習のオブジェクト配置やオブジェクト数に対しても良好な一般化を示しており、内挿を超えた体系的一般化能力を有している。
  • 内部モジュールにGQNを採用することで、性能を維持しつつも、より単純で効率的なアーキテクチャを実現している。
  • オブジェクトレベル表現により、正確なシーンレイアウト推論が可能であることが、ペアワイズ関係分類タスクでの高いパフォーマンスから裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。