Skip to main content
QUICK REVIEW

[論文レビュー] Towards causal generative scene models via competition of experts

Julius von Kügelgen, Ivan Ustyuzhaninov|arXiv (Cornell University)|Apr 27, 2020
Generative Adversarial Networks and Image Synthesis参考文献 47被引用数 21
ひとこと要約

この論文では、非ラベル付き画像からモジュラーでオブジェクト固有の表現を学ぶために、競合するエキスパートを用いる因果的生成的シーンモデルECONを提案する。深度順に逐次的に生成・推論を行うことで、再発するシーン構成要素に特化するエキスパートを訓練することにより、正しい奥行き順序と隠蔽関係を考慮した物理的に妥当なオブジェクトの再結合と制御可能なサンプリングを可能にする。

ABSTRACT

Learning how to model complex scenes in a modular way with recombinable components is a pre-requisite for higher-order reasoning and acting in the physical world. However, current generative models lack the ability to capture the inherently compositional and layered nature of visual scenes. While recent work has made progress towards unsupervised learning of object-based scene representations, most models still maintain a global representation space (i.e., objects are not explicitly separated), and cannot generate scenes with novel object arrangement and depth ordering. Here, we present an alternative approach which uses an inductive bias encouraging modularity by training an ensemble of generative models (experts). During training, experts compete for explaining parts of a scene, and thus specialise on different object classes, with objects being identified as parts that re-occur across multiple scenes. Our model allows for controllable sampling of individual objects and recombination of experts in physically plausible ways. In contrast to other methods, depth layering and occlusion are handled correctly, moving this approach closer to a causal generative scene model. Experiments on simple toy data qualitatively demonstrate the conceptual advantages of the proposed approach.

研究の動機と目的

  • 視覚的シーンの因果的構造を捉える、物理的に妥当な構成的生成モデルの開発。
  • 複雑で非自明な配置や隠蔽を伴う多オブジェクトシーンを扱う際の、統合的生成モデルの限界の解消。
  • グローバルな共有特徴空間に依存せずに、無教師学習によりオブジェクト固有の表現を学習すること。
  • モジュラーで専門的なエキスパートを介して、オブジェクトの制御可能な生成と再結合を可能にすること。
  • 隠蔽などの物理的制約を尊重する、奥行き順に逐次的な生成プロセスとしてのシーン生成のモデル化。

提案手法

  • 各エキスパートは、特定のオブジェクトクラスまたは概念を表すように訓練された生成モデルのアンサンブルを用いる。
  • 訓練中、エキスパートはシーンの一部を説明するために競合し、残りの説明されていない領域については、勝者となるエキスパートのみが更新される。
  • シーン生成は奥行き順に後ろから前に進み、自然な隠蔽とレイヤー構造が得られる。
  • 推論ではプロセスを逆転させ、各ステップで最も顕著な未説明領域を説明するためにエキスパートが競合し、隠蔽されたオブジェクトの補完が可能になる。
  • 競合メカニズムによりエキスパートの特化が促進され、各エキスパートは自身の割り当てられたオブジェクトクラスの完全で遮られることのないインスタンスを生成するよう学習する。
  • モデルは事前に分かっている最大オブジェクトクラス数Kを仮定し、形状とオブジェクトが与えられたもとで画素値を条件付き独立なガウス分布としてモデル化する。

実験結果

リサーチクエスチョン

  • RQ1無教師モデルは、エキスパート間の競合を通じて、再結合可能なオブジェクト固有の構成要素に複雑なシーンを分解できるか?
  • RQ2順次的で奥行き順の構造を持つ生成モデルは、シーン構成における隠蔽と奥行きレイヤーを正しく処理できるか?
  • RQ3エキスパート間の競合は、明示的な教師信号なしに、異なるオブジェクトクラスに自然に特化する結果をもたらすか?
  • RQ4異なるオブジェクトクラスで訓練されたエキスパートを再結合することで、新しいシーン構成を生成できるか?
  • RQ5統合的生成モデルと比較して、モジュラーでエキスパートベースのアプローチは、構成的かつ因果的シーン構造のモデル化においてどのように優れているか?

主な発見

  • ECONモデルは、エキスパートの競合による訓練を通じて、オブジェクトの奥行き順レイヤーにシーンを分解することに成功した。
  • エキスパートは異なるオブジェクトクラスに特化しており、オブジェクトはトレーニング画像全体にわたって再発する連続領域として同定される。
  • 特定のエキスパートを選択することで、個々のオブジェクトの制御可能なサンプリングが可能となり、モジュラーな再利用が可能である。
  • 新しい奥行き順の配置でエキスパートを再結合することで、新しいシーン構成が生成され、物理的妥当性が保持された。
  • 推論中に隠蔽領域が補完され、エキスパートが完全で遮られることのないオブジェクトインスタンスを生成するよう学習する。
  • 単純なトイデータ上で、構成的かつ因果的シーン生成のモデリングにおいて、統合的生成モデルを凌駕する定性的な成功を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。