Skip to main content
QUICK REVIEW

[論文レビュー] Object Scene Representation Transformer

Mehdi S. M. Sajjadi, Daniel Duckworth|arXiv (Cornell University)|Jun 14, 2022
Advanced Vision and Imaging被引用数 11
ひとこと要約

OSRTは、光場パarametrizationと新しいスロットミキサー・デコーダーを用いた3次元中心的で自己教師ありのニューラルシーン表現モデルであり、1回の順方向伝搬でピクセルごとにレンダリング可能な新規視点合成を通じて、オブジェクト中心の分解を学習する。オブジェクト数にかかわらず1ピクセルあたり1回のパスでレンダリングが可能であるため、従来手法の3,000倍以上高速であり、オブジェクト発見と3次元一貫性の両面で最先端の性能を達成している。

ABSTRACT

A compositional understanding of the world in terms of objects and their geometry in 3D space is considered a cornerstone of human cognition. Facilitating the learning of such a representation in neural networks holds promise for substantially improving labeled data efficiency. As a key step in this direction, we make progress on the problem of learning 3D-consistent decompositions of complex scenes into individual objects in an unsupervised fashion. We introduce Object Scene Representation Transformer (OSRT), a 3D-centric model in which individual object representations naturally emerge through novel view synthesis. OSRT scales to significantly more complex scenes with larger diversity of objects and backgrounds than existing methods. At the same time, it is multiple orders of magnitude faster at compositional rendering thanks to its light field parametrization and the novel Slot Mixer decoder. We believe this work will not only accelerate future architecture exploration and scaling efforts, but it will also serve as a useful tool for both object-centric as well as neural scene representation learning communities.

研究の動機と目的

  • RGB画像からの自己教師ありで3次元一貫性がありオブジェクト中心のシーン表現を学習すること。
  • 従来のオブジェクト中心の3次元レンダリング手法が数千回のデコーディングパスを要する計算上のボトル neck を克服すること。
  • トレーニング時に見たオブジェクト数よりも多いオブジェクトを含むシーンへの一般化を可能にすること。
  • 追加の正則化や教師信号なしにL2損失のみを用いて、高品質で3次元一貫性のあるオブジェクト分解を達成すること。
  • 多数のオブジェクトを含む複雑で多様なシーンへ、オブジェクト中心のシーン表現学習をスケーラブルに拡張すること。

提案手法

  • OSRTは、光場パラメータライゼーションを用いたシーン表現トランスフォーマー(SRT)バックボーンを採用し、潜在的シーン表現から1回の順方向伝搬でピクセル値を直接予測する。
  • スロットアテンションモジュールが、集合埋め込み表現をオブジェクト中心のスロットシーン表現に変換し、各スロットがオブジェクトまたは背景部分に対応する。
  • 新規のスロットミキサー・デコーダーにより、すべてのスロットを同時に処理することで、任意の視点のレンダリングを効率的かつ1パスで実現し、個々のオブジェクトのデコーディングステップの必要性を排除する。
  • モデルは、追加の正則化や深度教師信号、明示的な背景モデリングなしに、ピクセル再構成の単純なL2損失でエンドツーエンドに訓練される。
  • 光場の定式化により、明示的な3次元教師信号がなくても、シーン再構成における空間的および3次元的一貫性が保証される。
  • アーキテクチャは学習済みおよびランダムなスロット初期化の両方をサポートしており、トレーニング時よりも多くのオブジェクトを含む分布外のシーンに対しても、頑健な一般化が可能である。

実験結果

リサーチクエスチョン

  • RQ1RGB画像と新規視点合成を教師信号として用いるだけで、3次元中心的かつオブジェクト中心のシーン表現を自己教師ありで学習可能か?
  • RQ2オブジェクト中心の3次元レンダリングの計算コストを、数千回のデコーディングパスから1ピクセルあたり1回の順方向伝搬に低減可能か?
  • RQ3テスト時にトレーニング時よりも多くのオブジェクトを含むシーンへの一般化性能はどの程度か?
  • RQ4新規視点間でオブジェクト分解の3次元一貫性はどの程度維持されるか?
  • RQ5明示的な教師信号(例:深度、インスタンスマスク)が欠如している場合、オブジェクト発見の品質は低下するか、あるいは向上するか?

主な発見

  • MSR-Hardデータセットにおいて、OSRTはFG-ARI比0.940を達成し、オブジェクト分解における高い3次元一貫性を示している。
  • 5枚の入力ビューを用いる場合、FG-ARI比は0.987にまで上昇し、限定的な教師信号下でも強い3次元一貫性を示している。
  • テスト時に7〜10個のオブジェクトを含むシーンに対しても、OSRTは効果的に一般化し、ランダムなスロット初期化でPSNR 33.36、FG-ARI 0.968を達成している。
  • スロットミキサー・デコーダーのおかげで、オブジェクト数に依存しない1パスレンダリングが可能となり、従来手法より3,000倍以上高速である。
  • CLEVR-3Dデータセットでは、学習済みスロット初期化で、インハウスのシーンにおいてPSNR 40.84、FG-ARI 0.996を達成している。
  • マスクの漏れやボロノイタイルレーションの失敗モードといった制限が存在するが、多様で複雑なシーンにおいてもOSRTは強力な性能を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。