Skip to main content
QUICK REVIEW

[論文レビュー] Deformable Generator Networks: Unsupervised Disentanglement of Appearance and Geometry

Xianglei Xing, Ruiqi Gao|arXiv (Cornell University)|Jun 16, 2018
Generative Adversarial Networks and Image Synthesis参考文献 60被引用数 21
ひとこと要約

本稿では、可学習な変形場を用いて、2つの独立した生成ネットワーク(外観用と幾何変形用)を用いて、教師なしで画像および動画の外観要因と幾何要因を分離する変形可能生成ネットワークを提案する。本手法は最先端の分離性能を達成し、類似した構造的規則性を示すデータセット間で幾何的表現を転送可能にする。

ABSTRACT

We present a deformable generator model to disentangle the appearance and geometric information for both image and video data in a purely unsupervised manner. The appearance generator network models the information related to appearance, including color, illumination, identity or category, while the geometric generator performs geometric warping, such as rotation and stretching, through generating deformation field which is used to warp the generated appearance to obtain the final image or video sequences. Two generators take independent latent vectors as input to disentangle the appearance and geometric information from image or video sequences. For video data, a nonlinear transition model is introduced to both the appearance and geometric generators to capture the dynamics over time. The proposed scheme is general and can be easily integrated into different generative models. An extensive set of qualitative and quantitative experiments shows that the appearance and geometric information can be well disentangled, and the learned geometric generator can be conveniently transferred to other image datasets to facilitate knowledge transfer tasks.

研究の動機と目的

  • 教師なしで画像および動画データの外観と幾何の分離可能で解釈可能な表現を学習すること。
  • 外観要因(色、識別子、照明)と幾何要因(回転、スケーリング、形状)を独立した潜在変数で分離すること。
  • 類似した構造的規則性を示す他のデータセットへ幾何的表現の知識転送を可能にすること。
  • 外観および幾何要因の両方の時間的変動を非線形遷移モデルでモデル化すること。
  • さまざまな深層生成モデルと互換性のある汎用フレームワークを提供すること。

提案手法

  • モデルは2つの独立した生成ネットワークを用いる:外観生成ネットワーク(画像強度を出力)と幾何生成ネットワーク(密な2次元変形場を出力)。
  • 幾何生成ネットワークは画素ごとの変位ベクトルを出力し、空間変換層を介して微分可能に外観特徴マップを変形する。
  • 外観と幾何をそれぞれ制御する独立した潜在変数 $ Z^a $ と $ Z^g $ を用いることで、分離可能な生成が可能になる。
  • 動画データの場合、外観および幾何ストリームの両方の潜在要因の時間的変化をモデル化するための非線形遷移モデルを導入する。
  • 変分推論の目的関数を用い、モデルパラメータと潜在変数の両方を逆伝播することで、バランスパラメータ $ \beta $ を介して訓練を繰り返し行う。
  • 統合された確率的モデルとしてフレームワークを統合し、両生成ネットワークおよび変形操作を含むエンドツーエンドのバックプロパゲーション訓練をサポートする。

実験結果

リサーチクエスチョン

  • RQ1画像および動画データにおいて、完全に教師なしで外観と幾何要因を効果的に分離できるか?
  • RQ2学習された幾何生成ネットワークは、類似した構造的規則性を示す他のデータセットへ転送可能か?
  • RQ3教師なしで、動画シーケンスにおける動的な外観および幾何的変化をどれほど正確に捉えることができるか?
  • RQ4標準的な生成モデルと比較して、変形場の使用が分離性を向上させるか?
  • RQ5個々の潜在変数を操作することで、制御可能な画像/動画生成が可能か?

主な発見

  • 提案手法は、定性的および定量的評価を通じて、画像および動画データの両方で外観と幾何の良好な分離表現を達成している。
  • 1つのデータセットで学習した幾何生成ネットワークは、類似した構造的規則性を示す他のデータセットへ成功裏に転送可能であり、効果的なゼロショット知識転送を実現している。
  • 動的変形可能生成ネットワークモデルは、動画シーケンスにおける追跡不能な動き(外観遷移によるもの)と追跡可能な動き(幾何遷移によるもの)の両方を効果的に捉えている。
  • $ \beta = 0.3 $ の場合、再構成と分離性のバランスが取れ、高品質で分離されたサンプルが得られている。
  • 変形場機構により、幾何的変換に対する明示的な制御が可能となり、従来のGANやVAEと比較して解釈性および分離性が向上している。
  • モデルは汎用性に優れ、さまざまな生成アーキテクチャに統合可能であり、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。