Skip to main content
QUICK REVIEW

[論文レビュー] Object-Centric Image Generation with Factored Depths, Locations, and Appearances

Titas Anciukevicius, Christoph H. Lampert|arXiv (Cornell University)|Apr 1, 2020
Generative Adversarial Networks and Image Synthesis参考文献 25被引用数 8
ひとこと要約

本論文は、明示的な2次元位置、深度、外観、および非視認領域を含むマスクを有する別個の物体に画像コンテンツを要因分解する、完全に教師なしのオブジェクト中心の生成モデルを提案する。構造的ラティス空間と学習されていない微分可能な画像合成プロセスを活用することで、モデルは教師なしに画像を再構成し、遮蔽されている場合でも完全なオブジェクトを生成し、正確な深度順序と遮蔽された部分を推論する。教師なし設定において最先端の非視認領域セグメンテーションを達成する。

ABSTRACT

We present a generative model of images that explicitly reasons over the set of objects they show. Our model learns a structured latent representation that separates objects from each other and from the background; unlike prior works, it explicitly represents the 2D position and depth of each object, as well as an embedding of its segmentation mask and appearance. The model can be trained from images alone in a purely unsupervised fashion without the need for object masks or depth information. Moreover, it always generates complete objects, even though a significant fraction of training images contain occlusions. Finally, we show that our model can infer decompositions of novel images into their constituent objects, including accurate prediction of depth ordering and segmentation of occluded parts.

研究の動機と目的

  • オブジェクトレベルのアノテーションを一切用いずに、明示的な2次元位置、深度、外観を有するオブジェクトに画像を分解できる生成モデルを開発すること。
  • 訓練画像に遮蔽が含まれていても、完全で現実的なオブジェクトおよびシーンを生成できるようにすること。
  • 教師なしで、非視認領域セグメンテーション(隠れた部分を含む)と、新しい画像におけるオブジェクトの正しい深度順序を推論できること。
  • ラティス空間において、オブジェクトの外観、位置、深度を分離可能で解釈可能な表現にすること。

提案手法

  • モデルは、背景と各オブジェクトを別々に表す変数を有する構造的ラティス空間を用い、外観埋め込み、2次元位置、深度、アルファマスクを含む。
  • 学習されていないが微分可能な画像合成プロセスにより、オブジェクトの位置、深度、アルファマスクに基づいて合成され、現実的な遮蔽を模倣する。
  • 変分推論を用いて、入力画像を再構成するための訓練を実施し、入力ピクセルからオブジェクト要因を推定する。
  • オブジェクトの位置と深度は明示的にラティス変数としてモデル化され、遮蔽順序と非視認領域の広がりを推論可能にする。
  • デコーダは、外観を処理するための深層ニューラルネットワークを用いて、各オブジェクトを独立に生成するが、合成プロセスにより物理的整合性が保証される。
  • データから学習する代わりに、画像形成に関する事前知識(例:深度順序、アルファ合成)を活用する。

実験結果

リサーチクエスチョン

  • RQ1完全に教師なしの生成モデルは、明示的な2次元位置、深度、非視認領域マスクを有するオブジェクトに画像を要因分解できるか?
  • RQ2このようなモデルは、セグメンテーションアノテーションなしで、遮蔽されたオブジェクトの完全(非視認領域)範囲を推論できるか?
  • RQ3構造的ラティス空間により、オブジェクトの位置、外観、深度を独立して制御できるか?
  • RQ4新しい画像における重なったオブジェクト間の深度順序を正確に予測できるか?

主な発見

  • 重なった多角形とCLEVR-3において、非視認領域IOUの平均が0.90を達成し、教師なし非視認領域セグメンテーションの強力な性能を示す。
  • 小さなオブジェクトと複雑な背景を特徴とするCLEVR-5-vbgでは、非視認領域IOUが0.65に達し、依然としてランダムの水準を著しく上回る。
  • CLEVR-3では重なったオブジェクトペアの92%、重なった多角形では87%で正しい深度順序を予測し、CLEVR-5-vbgでは70%の正確性を示す。
  • ラティス空間における分離可能な補間により、外観と位置を視覚的アーチファクトを生成せずに独立して変更でき、表現の分離性が確認された。
  • 訓練画像に顕著な遮蔽が含まれていても、現実的で整合性のあるシーンと妥当な孤立オブジェクトを生成できる。
  • 同程度の容量を持つ非オブジェクト中心のベースラインと比較して、画像生成品質と分離性の両面で優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。