Skip to main content
QUICK REVIEW

[論文レビュー] Generative Adversarial Image Synthesis with Decision Tree Latent Controller

Takuhiro Kaneko, Kaoru Hiramatsu|arXiv (Cornell University)|May 27, 2018
Generative Adversarial Networks and Image Synthesis被引用数 3
ひとこと要約

本稿では、段階的解釈可能な表現を意思決定木潜在コントローラー(DTLC)を介して学習する生成対抗ネットワーク、DTLC-GANを提案する。この手法により、詳細な教師信号を必要とせず、粗い段階から細かい段階への画像生成が可能になる。階層的条件付き相互情報量正則化とカリキュラム学習戦略を統合することで、層間における意味的特徴の分離が達成され、CIFAR-10で8.80の最先端のインceptionスコアを達成するとともに、属性固有のSSIMスコアが向上した有効な画像検索が可能になる。

ABSTRACT

This paper proposes the decision tree latent controller generative adversarial network (DTLC-GAN), an extension of a GAN that can learn hierarchically interpretable representations without relying on detailed supervision. To impose a hierarchical inclusion structure on latent variables, we incorporate a new architecture called the DTLC into the generator input. The DTLC has a multiple-layer tree structure in which the ON or OFF of the child node codes is controlled by the parent node codes. By using this architecture hierarchically, we can obtain the latent space in which the lower layer codes are selectively used depending on the higher layer ones. To make the latent codes capture salient semantic features of images in a hierarchically disentangled manner in the DTLC, we also propose a hierarchical conditional mutual information regularization and optimize it with a newly defined curriculum learning method that we propose as well. This makes it possible to discover hierarchically interpretable representations in a layer-by-layer manner on the basis of information gain by only using a single DTLC-GAN model. We evaluated the DTLC-GAN on various datasets, i.e., MNIST, CIFAR-10, Tiny ImageNet, 3D Faces, and CelebA, and confirmed that the DTLC-GAN can learn hierarchically interpretable representations with either unsupervised or weakly supervised settings. Furthermore, we applied the DTLC-GAN to image-retrieval tasks and showed its effectiveness in representation learning.

研究の動機と目的

  • 詳細なアノテーションや教師信号を必要とせず、階層的で解釈可能な表現を学習する深層生成モデルの開発。
  • 階層的包含性を強制する意思決定木アーキテクチャにより潜在変数を構造化することで、粗い段階から細かい段階への画像生成の実現。
  • クラスレベルまたは弱い教師信号のみを用いて、複数の層間、層内、および制御ターゲット間で意味的特徴の分離を達成すること。
  • 分離された階層的潜在空間を活用することで、画像検索を含む下流タスクの表現学習を向上させること。

提案手法

  • 子ノードのコードが親ノードがオンになっている場合にのみ活性化される多層構造の意思決定木潜在コントローラー(DTLC)を導入し、潜在空間における階層的包含性を強制する。
  • 各段階での情報量の増加を最大化することで、層間における意味的特徴の分離を促進するため、階層的条件付き相互情報量(HCMI)正則化を提案する。
  • 上位層から順に段階的に学習を進めるカリキュラム学習法を設計し、訓練の安定性と分離の向上を図る。
  • 訓練安定性を確保するため、WGAN-GPに勾配ペナルティを適用し、性能評価にはインセプションスコアとSSIMに基づく検索指標を用いる。
  • 下流の画像検索タスク用に、潜在コード $\hat{\bm{c}}_l$ を予測する補助ネットワーク $Q_l$ を採用する。
  • 離散的および連続的潜在コードの両方を適用し、3D FacesおよびCelebAデータセットでカテゴリ特異的な制御の有効性を実証する。

実験結果

リサーチクエスチョン

  • RQ1クラスレベルのラベルのみに依存して、詳細な教師信号を必要とせず、GANが階層的で分離可能な表現を学習できるか?
  • RQ2意思決定木構造の潜在コントローラーは、階層的包含性を強制し、粗い段階から細かい段階への画像生成を可能にするか?
  • RQ3階層的条件付き相互情報量正則化は、複数の層間における意味的特徴の分離を向上させるか?
  • RQ4提案されたカリキュラム学習法は、訓練の安定性を向上させるとともに、段階的に解釈可能な表現を効果的に発見できるか?
  • RQ5学習された階層的潜在空間は、画像検索タスクの性能向上に寄与するか?

主な発見

  • DTLC-GANは、CIFAR-10でクラスラベルのみを用いてもインセプションスコア8.80を達成し、弱い教師信号下での先行手法を上回る性能を示した。
  • CelebAデータセットでは、第1層で0.150であった属性固有のSSIMスコアが、第3層でメガネの属性で0.265、笑顔の属性で0.326に向上し、意味的属性との整合性が向上していることが示された。
  • モデルは、多様で高精細な画像を制御可能な変化を伴って生成でき、例として第2層のコードを変更するとメガネの種類などの広範な属性が変化し、下位層のコードではリムの厚さなどの詳細が微調整される。
  • 3D Facesでは、連続的コードを用いたDTLC-GANが、上位のカテゴリカルコードに条件付けられたポーズ固有の意味的特徴を学習しているのに対し、平坦なInfoGANではコード同士が独立しているため、そのような制御は不可能である。
  • カリキュラム学習法により、安定した訓練が可能となり、より深い層が追加されるごとに階層的表現の発見が効果的に行われる。
  • 階層的コードを用いた画像検索では、より深い層がクエリ属性と高い一致を示し、分離された潜在空間の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。