Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised object-centric video generation and decomposition in 3D

Paul Henderson, Christoph H. Lampert|ENLIGHTEN (Jurnal Bimbingan dan Konseling Islam)|Jul 7, 2020
Advanced Vision and Imaging参考文献 47被引用数 4
ひとこと要約

本論文は、3D空間を明示的に扱う、アノテーションなしでモノクロナル動画を3Dオブジェクトと背景に分解できる、初めての教師なしオブジェクト中心の動画生成モデルO3Vを提案する。カメラが独立したオブジェクトで構成される3Dシーンを移動するものとしてモデル化し、学習可能な3Dポーズと外観を有する。このアプローチにより、動画生成、深度推定、3Dオブジェクト検出、インスタンスセグメンテーションの分野で最先端の性能を達成し、2Dタスクに対しても従来手法を上回る。

ABSTRACT

A natural approach to generative modeling of videos is to represent them as a composition of moving objects. Recent works model a set of 2D sprites over a slowly-varying background, but without considering the underlying 3D scene that gives rise to them. We instead propose to model a video as the view seen while moving through a scene with multiple 3D objects and a 3D background. Our model is trained from monocular videos without any supervision, yet learns to generate coherent 3D scenes containing several moving objects. We conduct detailed experiments on two datasets, going beyond the visual complexity supported by state-of-the-art generative approaches. We evaluate our method on depth-prediction and 3D object detection -- tasks which cannot be addressed by those earlier works -- and show it out-performs them even on 2D instance segmentation and tracking.

研究の動機と目的

  • 2Dまたは2.5D表現に依存するのではなく、3D空間を明示的に扱うオブジェクト中心の動画生成モデルを開発すること。
  • 3Dアノテーションや監視情報なしに、モノクロナル動画のみを用いて教師なしでモデルを学習すること。
  • 動画を3Dフォアグラウンドオブジェクトと3Dバックグラウンドに分離可能に分解し、一貫したトラッキングと深度推定を可能にすること。
  • 3D環境を背景に動く3Dオブジェクトを示す一貫性のある、現実的で整合性のある動画シーケンスを生成すること。

提案手法

  • モデルは、全3Dシーンを表す1つの潜在変数zを用い、これによりオブジェクト固有の3Dポーズ、外観埋め込み、バックグラウンドの形状とテクスチャにデコードする。
  • 各オブジェクトの外観埋め込みは、専用のデコーダーを用いて3Dボクセルまたはメッシュ表現に変換され、明示的な3D形状と色のモデリングを可能にする。
  • カメラパラメータを用いてオブジェクトとバックグラウンドを微分可能にレンダリングし、アルファブレンドによる合成により最終的な動画フレームを形成する。
  • 潜在コードから入力動画を再構築するように、微分可能レンダラとピixe単位の再構築損失を用いて、変分オートエンコーダー(VAE)として訓練する。
  • オブジェクトを独立してモデル化し、ポーズと外観を分離することで、効率的で構成的なシーン表現を実現するインダクティブバイアスを導入する。
  • 構造的デコーダーが潜在コードを解釈し、オブジェクトの存在インジケータ、3D位置、回転、変形を生成することで、現実的なシーンレイアウトを保証する。
Figure 1 : Left: Our generative model of videos has a single latent variable $\mathbf{z}$ , which is decoded by $F^{\mathrm{obj}}$ to parameters of $G$ objects. The contents of the green plate are replicated once per object; the contents of the blue plate are replicated once per frame. Each object h
Figure 1 : Left: Our generative model of videos has a single latent variable $\mathbf{z}$ , which is decoded by $F^{\mathrm{obj}}$ to parameters of $G$ objects. The contents of the green plate are replicated once per object; the contents of the blue plate are replicated once per frame. Each object h

実験結果

リサーチクエスチョン

  • RQ1教師なしでオブジェクト中心の動画生成モデルは、3D監視やアノテーションなしに、動画を3Dオブジェクトと3Dバックグラウンドに分解できるか?
  • RQ22Dまたは2.5Dアプローチと比較して、3D空間でシーンをモデル化することで、深度推定、3Dオブジェクト検出、インスタンスセグメンテーションといった下流タスクの一般化性能と性能が向上するか?
  • RQ31つの潜在コードが、重なったオブジェクトなど現実的でないレイアウトを避けるために、妥当な3Dシーン構造の全空間を捉えられるか?
  • RQ42Dスプライトベースのモデルと比較して、3Dリーズニングは動画生成品質と分離性をどのように向上させるか?
  • RQ5複数の移動オブジェクトや変化する視点を含む複雑なシーンに対し、モデルはどの程度一般化できるか?

主な発見

  • 『traffic』データセットにおいて、O3V-voxelはFVD、FID、KIDスコアで最高を記録し、GENESIS や MONet を含むすべてのベースラインを大きく上回った。
  • 『rooms』データセットでは、O3V-voxelはFIDおよびKIDでMONet や SCALOR を上回り、現実的で一貫性のあるオブジェクトの動きを示す高品質なシーンを生成した。
  • O3Vは、従来の2Dまたは2.5Dモデルが取り扱わない3Dオブジェクト検出および深度推定の分野でも最先端の性能を達成し、3Dリーズニングの利点を示した。
  • モデルは動画を3Dオブジェクトとバックグラウンドに成功裏に分解し、正確なセグメンテーションマスクと時間的整合性のあるトラッキングを生成した。
  • 『rooms』データセットでは、O3V-meshがO3V-voxelよりもFIDおよびKIDスコアで優れており、メッシュレンダリングによる鋭いエッジの恩恵があると考えられる。一方、『traffic』データセットではO3V-voxelが優位であった。
  • 失敗事例では、モデルが1つのオブジェクト(例:車)を2つの部分に分割することがあるが、その部分はしばしば一貫して動くため、部分的な分離性の問題が示唆される。
Figure 2 : Videos from (rooms) decomposed by O3V-voxel. In each block, the three rows are different frames. The columns are (left to right): input frame, reconstructed frame, reconstructed background, reconstructed foreground objects and 3D bounding boxes, ground-truth and predicted instance segment
Figure 2 : Videos from (rooms) decomposed by O3V-voxel. In each block, the three rows are different frames. The columns are (left to right): input frame, reconstructed frame, reconstructed background, reconstructed foreground objects and 3D bounding boxes, ground-truth and predicted instance segment

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。