Skip to main content
QUICK REVIEW

[論文レビュー] Generative Cooperative Net for Image Generation and Data Augmentation

Qiangeng Xu, Zengchang Qin|arXiv (Cornell University)|May 8, 2017
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本論文では、顔の表情や色・回転変換などの所望の高レベル特徴を有する未学習の画像を高品質に生成する教師あり生成モデルである Generative Cooperative Net (GCN) を提案する。GAN とは異なり、敵対的損失を用いず協調的トレーニングを採用することで、データ拡張が効果的になり、KDEF データセットにおける認識精度を 92% から 94% まで向上させた。325 枚の実際の顔画像から 21,125 枚の合成顔画像を生成した。

ABSTRACT

How to build a good model for image generation given an abstract concept is a fundamental problem in computer vision. In this paper, we explore a generative model for the task of generating unseen images with desired features. We propose the Generative Cooperative Net (GCN) for image generation. The idea is similar to generative adversarial networks except that the generators and discriminators are trained to work accordingly. Our experiments on hand-written digit generation and facial expression generation show that GCN's two cooperative counterparts (the generator and the classifier) can work together nicely and achieve promising results. We also discovered a usage of such generative model as an data-augmentation tool. Our experiment of applying this method on a recognition task shows that it is very effective comparing to other existing methods. It is easy to set up and could help generate a very large synthesized dataset.

研究の動機と目的

  • 顔の表情や色・回転属性などの特定の高レベル視覚的特徴を有する未学習の画像を生成できる生成モデルを開発すること。
  • 既存の GAN ベースのモデルが画像品質を維持しながら特定の意味的特徴を制御する点で制限を抱えているのを是正すること。
  • このような生成モデルを認識タスクの強力なデータ拡張ツールとして活用することを検討すること。
  • 分類器ガイドドの生成器を介した知識移譲により、大規模データセットへの依存を軽減すること。
  • 生成器と分類器の協調的トレーニングが、画像合成における一般化性能と概念保存性を向上させることを示すこと。

提案手法

  • GCN フレームワークは、Dosovitskiy 他 (2015) のデコンボリューションネットワークアーキテクチャに基づく生成器と、変更を加えた AlexNet を用いた分類器から構成される。
  • 再構成損失と分類損失の両方を最小化する共同目的関数を用いて、エンドツーエンドでモデルをトレーニングする。
  • トレーニングデータは、高レベル特徴ベクトル(例:感情ラベル、色、回転)とそれに対応する画像のペアから構成される。
  • 生成器は潜在的特徴ベクトルから画像を合成するのに対し、分類器は意味的整合性と特徴の忠実度を保証する。
  • 異なるアイデンティティの特徴を補間または組み合わせることで、ゼロショット生成(例:既知のアイデンティティに新しい表情を適用)を可能にする。
  • アイデンティティを保持しつつ、感情や外見を変更する多様で意味的に整合性のある画像を生成することで、データ拡張に応用する。

実験結果

リサーチクエスチョン

  • RQ1協調的生成モデルは、顔の表情などの所望の高レベル視覚的特徴を有する高品質で未学習の画像を生成できるか?
  • RQ2生成器と分類器の協調的トレーニングは、GAN の敵対的トレーニングに比べて、制御された画像生成においてどのように異なるか?
  • RQ3GCN モデルは、トレーニングセットに存在しない画像、例えば新しい感情アイデンティティや変換に対してどれほど一般化できるか?
  • RQ4GCN は、実データが限られている場合に認識タスクの有効なデータ拡張法として機能できるか?
  • RQ5モデルは特定の意味的属性(感情や色)を変更しながらも、被写体のアイデンティティを保持しており、現実的かつ信頼できる合成が可能か?

主な発見

  • GCN は、トレーニングセットに存在しなかった組み合わせでも、笑顔、驚き、嫌悪などの顔の表情を含む、所望の高レベル特徴を有する高品質な未学習画像を効果的に生成した。
  • データ拡張後、顔の表情認識タスクにおける精度が元のデータセットの 92% から 94% まで向上し、GCN が生成したデータの有効性を示した。
  • アイデンティティと感情を 0.5:0.5 の割合で組み合わせることで、325 枚の実際の顔画像から 21,125 枚の合成顔画像を生成し、高いデータ効率を示した。
  • トレーニングデータに明示的に含まれていなかった 90 度および 180 度の回転変換に対しても、低レベル特徴を学習したため、特徴の一般化が強く示された。
  • 色が欠落している場合など、欠落した特徴を生成する際、変換を欠落させた場合よりも優れた一般化性能を示した。
  • 合成画像は被写体のアイデンティティを保持しながら、ターゲットの感情を正確に反映しており、後続タスクにおける信頼性と実用性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。