Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised multi-modal Styled Content Generation

Omry Sendik, Dani Lischinski|arXiv (Cornell University)|Jan 10, 2020
Natural Language Processing Techniques参考文献 27被引用数 4
ひとこと要約

本稿では、K 個の学習されたルート定数を導入することで、複数の潜在モードを有する多様態のデータ分布を教師なしで学習する新しい生成モデル uMM-GAN を提案する。これにより、動物種(例:ネコ vs 犬)のようなモードと、毛の色(例:茶色)のようなスタイルを分離して制御可能となる。この手法は、ベースラインの GAN よりも分布近似性能と FID スコアを向上させ、K が真のモード数と等しいかそれを上回る場合に顕著な改善を示す。

ABSTRACT

The emergence of deep generative models has recently enabled the automatic generation of massive amounts of graphical content, both in 2D and in 3D. Generative Adversarial Networks (GANs) and style control mechanisms, such as Adaptive Instance Normalization (AdaIN), have proved particularly effective in this context, culminating in the state-of-the-art StyleGAN architecture. While such models are able to learn diverse distributions, provided a sufficiently large training set, they are not well-suited for scenarios where the distribution of the training data exhibits a multi-modal behavior. In such cases, reshaping a uniform or normal distribution over the latent space into a complex multi-modal distribution in the data domain is challenging, and the generator might fail to sample the target distribution well. Furthermore, existing unsupervised generative models are not able to control the mode of the generated samples independently of the other visual attributes, despite the fact that they are typically disentangled in the training data. In this paper, we introduce UMMGAN, a novel architecture designed to better model multi-modal distributions, in an unsupervised fashion. Building upon the StyleGAN architecture, our network learns multiple modes, in a completely unsupervised manner, and combines them using a set of learned weights. We demonstrate that this approach is capable of effectively approximating a complex distribution as a superposition of multiple simple ones. We further show that UMMGAN effectively disentangles between modes and style, thereby providing an independent degree of control over the generated content.

研究の動機と目的

  • 教師なし条件下で多様態のデータ分布をモデル化できない既存の GAN の限界を解消すること。
  • 生成サンプルのモード(例:ネコ vs 犬)をスタイル属性(例:毛の色)とは独立して制御できることを実現すること。
  • K 個のより単純な学習済みモードの重ね合わせとして複雑なデータ分布を近似することで、生成サンプルの忠実性と多様性を向上させること。
  • 複数のルート定数を用いた教師なしのモード発見が、単一ルート GAN よりも優れた分布近似を達成することを示すこと。

提案手法

  • モデルは、1つの学習定数を採用する StyleGAN を拡張し、K 個の異なるルート定数を導入。各定数はデータ分布内での異なるモードのシードとして機能する。
  • 各生成サンプルは、K 個のモード固有の特徴の重み付き混合によって構成され、重みは学習中に最適化される。
  • 生成器は AdaIN を用いてスタイル制御を行うが、モード選択は K 個のルート定数によって分離されるため、モードとスタイルの独立した操作が可能となる。
  • アドバーシャル損失を用いてエンドツーエンドで訓練され、分類ラベルやアノテーションは一切不要である。
  • モード数 K はハイパーパrameterであり、モデルはデータ分布に基づいて各サンプルを最も関連性の高いモードに割り当てるよう学習する。
  • 各ルート定数が異なる高レベルのコンテンツ特徴(例:種、物体の姿勢)を捉えるよう促すことで、モードの分離が暗黙的に学習される。

実験結果

リサーチクエスチョン

  • RQ1教師なしの GAN アーキテクチャは、分類ラベルなしで多様態のデータ分布を効果的にモデル化できるか?
  • RQ2K 個のルート定数を用いて複数の潜在モードを学習することで、単一ルート GAN よりも分布近似性能が向上するか?
  • RQ3生成モデルにおいてモードとスタイルを効果的に分離できるか。これにより、高レベルのコンテンツと視覚的外観を独立して制御できるか?
  • RQ4学習済みモード数 K の値が、FID スコアで測定された生成サンプルの品質にどのように影響するか?
  • RQ5本モデルは、複雑な現実世界の多様態分布を持つ自然画像データセットに対しても一般化可能か?

主な発見

  • uMM-GAN は、多様態データセットにおいてベースラインの StyleGAN よりも顕著に低い FID スコアを達成し、3クラスのデータセットで K を 2 から 3 に増加させた際、最大 1.47 FID ポイントの改善を示した。
  • ネコと犬のデータセットでは、K=1 の場合の FID スコア 126.90 が、K=16 時に 103.49 に低下し、K の増加に伴う一貫した改善が確認された。
  • 自動車と寝室のデータセットでは、それぞれ K=1 時の FID スコアが 167.22 から 145.54 に、189.53 から 157.01 に低下し、複雑な自然画像に対しても有効であることが示された。
  • モードを切り替えてもスタイルパラメータ(例:毛の色や模様)が保持されるサンプルが得られており、モードとスタイルの分離が成功していることが確認された。
  • K ≥ N(真のモード数)のときモデル性能が最良となり、K ≫ N の場合は利得が減少する傾向にあり、モード容量のトレードオフが示された。
  • 本手法は合成データ(文字)から現実世界のデータ(動物、自動車、インテリア)まで幅広く一般化可能であり、データの複雑さにかかわらず高い頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。