Skip to main content
QUICK REVIEW

[論文レビュー] Unpaired Multi-Domain Image Generation via Regularized Conditional GANs

Xudong Mao, Qing Li|arXiv (Cornell University)|May 7, 2018
Generative Adversarial Networks and Image Synthesis参考文献 25被引用数 4
ひとこと要約

本稿では、ペaired学習データが存在しない状況下でもドメイン間の対応関係を学習できる、非ペア多ドメイン画像生成のためのフレームワークである正則化付き条件付きGAN(RegCGAN)を提案する。生成器の最初の層に共通の高レベル意味的特徴を強制する正則化項と、識別器の最終層に不変な特徴表現を生成する正則化項を導入することで、エッジから写真への変換、属性付き顔、ドメイン適応タスクなど、多様なドメイン間で整列した画像ペアの生成において最先端の性能を達成した。

ABSTRACT

In this paper, we study the problem of multi-domain image generation, the goal of which is to generate pairs of corresponding images from different domains. With the recent development in generative models, image generation has achieved great progress and has been applied to various computer vision tasks. However, multi-domain image generation may not achieve the desired performance due to the difficulty of learning the correspondence of different domain images, especially when the information of paired samples is not given. To tackle this problem, we propose Regularized Conditional GAN (RegCGAN) which is capable of learning to generate corresponding images in the absence of paired training data. RegCGAN is based on the conditional GAN, and we introduce two regularizers to guide the model to learn the corresponding semantics of different domains. We evaluate the proposed model on several tasks for which paired training data is not given, including the generation of edges and photos, the generation of faces with different attributes, etc. The experimental results show that our model can successfully generate corresponding images for all these tasks, while outperforms the baseline methods. We also introduce an approach of applying RegCGAN to unsupervised domain adaptation.

研究の動機と目的

  • ペア学習データが利用できない状況下での多ドメイン画像生成の課題に対処すること。
  • ペア例が存在しない場合に標準的な条件付きGANがドメイン間対応関係を学習できない問題を克服すること。
  • ドメイン間で共有される高レベル意味的特徴を学習しつつ、ドメイン固有の特徴を保持する手法を開発すること。
  • 不変な特徴表現を用いて、モデルを非教師付きドメイン適応に応用できること。
  • ゼロショット画像翻訳およびドメイン適応タスクにおける一般化性能と性能を向上させること。

提案手法

  • 共有の潜在コードを用いて共通の意味的特徴を符号化する一方で、生成器と識別器をドメイン固有の変数で条件づける。
  • 同一の潜在コードだが異なるドメインコードを入力とした場合の出力間のL2距離をペナルティ化する、生成器の最初の層の正則化項を導入し、意味的整合性を強制する。
  • 対応する画像ペアに対して識別器の出力損失が類似するよう促すように、識別器の最終層に正則化項を追加し、生成器が整列した画像を出力するように誘導する。
  • 識別器の最後の隠れ層を不変な特徴表現を持つ特徴抽出器として用い、転移学習を可能にする。
  • 敵対的損失と2つの正則化項を重み付き和として組み合わせ、生成器と識別器を同時に訓練する。
  • 識別器の最終層に分類器を接続することで、学習された不変特徴を非教師付きドメイン適応に応用する。

実験結果

リサーチクエスチョン

  • RQ1ペア学習データが存在しない状況下でも、条件付きGANに正則化を施すことでドメイン間対応関係を学習できるか?
  • RQ2ペア例が存在しない状況下で、異なるドメイン間で共有される高レベル意味的特徴をどのように強制できるか?
  • RQ3識別器の最終層が、下流タスクに有用なドメインを越えて一般化可能な不変表現を生成できるか?
  • RQ4提案された正則化フレームワークは、非ペア画像翻訳およびドメイン適応において既存手法を上回る性能を発揮するか?
  • RQ5学習された特徴は、最小限のラベル付きデータで非教師付きドメイン適応にどの程度有効に応用できるか?

主な発見

  • RegCGANは、ペア学習データを一切使用せずに、エッジから写真への変換、顔の属性、モノネのスタイルの画像、季節の変化など、多様なドメイン間で対応する画像ペアを効果的に生成した。
  • MNISTからUSPS、USPSからMNISTへのドメイン適応タスクにおいて、それぞれ93.1%および89.5%の精度を達成し、DANN、ADDA、CoGANを上回った。
  • 標準テストセットにおいても、MNIST-to-USPSおよびUSPS-to-MNISTタスクでそれぞれ90.1%および88.8%の精度を達成し、ベースラインよりも優れた一般化性能を示した。
  • 潜在空間における滑らかな補間が可能であり、生成された画像ペアにおいてコンテンツおよびスタイルの両方が一貫した遷移を示した。
  • 識別器の最終層が学習した不変特徴表現は、効果的な転移学習を可能にし、非教師付きドメイン適応における手法の有効性を裏付けた。
  • 除去実験の結果、2つの正則化項の両方が不可欠であることが確認され、いずれかを削除すると画像翻訳およびドメイン適応タスクの性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。