Skip to main content
QUICK REVIEW

[論文レビュー] Sparsely Grouped Multi-task Generative Adversarial Networks for Facial Attribute Manipulation

Jichao Zhang, Yezhi Shu|arXiv (Cornell University)|May 19, 2018
Generative Adversarial Networks and Image Synthesis参考文献 65被引用数 3
ひとこと要約

本稿では、1つの入力から複数の出力を生成するGANアーキテクチャとして、スパースにグループ化された生成的対抗ネットワーク(SG-GAN)を提案する。このアーキテクチャは、各属性グループあたり少数のラベル付きサンプルのみを用いても、高品質な顔貌属性操作を実現する。未グループ化データに対する洗練された残差画像学習と非教師あり学習を統合することで、スパースにグループ化されたデータセットにおいて優れた性能を達成し、最小限の教師信号でもベースラインを上回るか同等の性能を発揮する。また、アイデンティティと背景の詳細を保持する。

ABSTRACT

Recent Image-to-Image Translation algorithms have achieved significant progress in neural style transfer and image attribute manipulation tasks. However, existing approaches require exhaustively labelling training data, which is labor demanding, difficult to scale up, and hard to migrate into new domains. To overcome such a key limitation, we propose Sparsely Grouped Generative Adversarial Networks (SG-GAN) as a novel approach that can translate images on sparsely grouped datasets where only a few samples for training are labelled. Using a novel one-input multi-output architecture, SG-GAN is well-suited for tackling sparsely grouped learning and multi-task learning. The proposed model can translate images among multiple groups using only a single commonly trained model. To experimentally validate advantages of the new model, we apply the proposed method to tackle a series of attribute manipulation tasks for facial images. Experimental results demonstrate that SG-GAN can generate image translation results of comparable quality with baselines methods on adequately labelled datasets and results of superior quality on sparsely grouped datasets. The official implementation is publicly available:https://github.com/zhangqianhui/Sparsely-Grouped-GAN.

研究の動機と目的

  • 教師あり画像対画像変換における高コストなラベル付けを軽減するため、各グループあたり少数のラベル付きサンプルでのみ学習可能なスパースにグループ化されたデータセットからの学習を可能にすること。
  • StarGAN や ResidualGAN などの既存モデルが完全にラベル付けされたペairedデータを必要としたり、ペアでないスパースラベル付けの状況で困難を抱えるのを克服すること。
  • 各属性ごとのモデル再訓練を必要とせず、1つの統合型モデルフレームワークとして、複数のタスクを実行可能な顔貌属性操作を実現すること。
  • 新規な残差学習メカニズムを用いて敵対的訓練を安定化させるとともに、変換画像におけるコンテンツとアイデンティティ、背景の詳細を保持すること。

提案手法

  • 1つの入力から複数の出力を生成するGANアーキテクチャを提案し、単一の共有ジェネレータとディスクライマーを用いて複数の顔貌属性変換を同時に学習する。
  • 入力と残差特徴間の算術的関係をよりよく学習できるように、要素ごとの加算を特徴の連結に置き換える洗練された残差画像学習(RRIL)コンponentsを導入する。
  • 未グループ化(ラベルなし)のサンプルを損失計算から除外する修正された再構成損失を採用し、スパースにグループ化されたデータに対して効果的な学習を可能にする。
  • 未グループ化データに対する非教師あり学習を活用することで、分類精度を向上させるとともに、敵対的訓練の安定性を高める。
  • 各属性グループあたり少数のサンプルのみをラベル付けし、残りは非教師あり事前学習に使用するスパースにグループ化されたデータセットの設定を採用する。
  • 敵対的損失とアイデンティティ損失を適用し、コンテンツを保持するとともに、高精細で現実的な画像変換を生成する。

実験結果

リサーチクエスチョン

  • RQ1各グループあたり少数のラベル付きサンプルでのみ学習可能な1つのGANモデルが、複数の属性に対して高品質な顔貌属性操作を達成できるか?
  • RQ2提案された洗練された残差画像学習メカニズムは、低データ環境下で標準的な残差学習と比較して、画像変換品質をどのように向上させるか?
  • RQ3未グループ化データに対する非教師あり学習は、スパースにグループ化された学習設定において、訓練の安定性と性能向上にどの程度寄与するか?
  • RQ4スパースラベルで学習した場合に、SG-GANはStarGAN や ResidualGAN と比較して、視覚的品質とアイデンティティ保持の点でどの程度優れているか?
  • RQ5一部の訓練サンプルで元のラベルが欠落している場合、再構成損失の設計が性能に与える影響は何か?

主な発見

  • SG-GANは、各グループあたり500個のラベル付きサンプルでのみ学習させても、StarGAN や ResidualGAN などの最先端モデルと同等またはそれ以上の画像変換品質を達成する。
  • 洗練された残差画像学習(RRIL)コンponentは、顔貌属性予測の分類精度を、残差学習なしの18.77%から、性別属性予測で93.26%まで著しく向上させる。
  • SG-GAN(500) と SG-GAN(5000) は、SG-GAN(ALL) とほぼ同等の性能を達成しており、ラベル付きデータが限られた状況でも頑健であることが示された。
  • アイデンティティと背景の特徴を効果的に保持しており、例えばSG-GAN(All)では72、ResidualGANでは63という高いアイデンティティ保持スコアが得られた。
  • 未グループ化のサンプルを損失計算から除外する修正再構成損失により、標準的なStarGANが失敗するスパースにグループ化されたデータでも安定した学習が可能になった。
  • 視覚的比較では、同じスパースデータで学習した場合に、SG-GANはStarGANよりもシャープで現実的な結果を生成しており、特に顔の構造の保持において優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。