Skip to main content
QUICK REVIEW

[論文レビュー] Dual Generator Generative Adversarial Networks for Multi-Domain Image-to-Image Translation

Hao Tang, Dan Xu|arXiv (Cornell University)|Jan 14, 2019
Advanced Image Processing Techniques参考文献 49被引用数 4
ひとこと要約

本稿では、1つのモデルでスケーラブルかつマルチドメインの非対応画像間翻訳を実現する二重生成器 GAN フレームワーク、G2GAN を提案する。従来の手法が各ドメインペアごとに複数のモデルを必要としたり、翻訳と再構築に1つの生成器を共有したりするのに対し、G2GAN はタスク固有の生成器(翻訳と再構築)を採用し、柔軟なパラメータ共有を実現することで、色のサイクル整合性、SSIM、アイデンティティ損失を統合的に最適化し、顔、風景、建物を含む6つのデータセットで最先端のモデルを上回る画像品質と安定性を達成する。

ABSTRACT

State-of-the-art methods for image-to-image translation with Generative Adversarial Networks (GANs) can learn a mapping from one domain to another domain using unpaired image data. However, these methods require the training of one specific model for every pair of image domains, which limits the scalability in dealing with more than two image domains. In addition, the training stage of these methods has the common problem of model collapse that degrades the quality of the generated images. To tackle these issues, we propose a Dual Generator Generative Adversarial Network (G$^2$GAN), which is a robust and scalable approach allowing to perform unpaired image-to-image translation for multiple domains using only dual generators within a single model. Moreover, we explore different optimization losses for better training of G$^2$GAN, and thus make unpaired image-to-image translation with higher consistency and better stability. Extensive experiments on six publicly available datasets with different scenarios, i.e., architectural buildings, seasons, landscape and human faces, demonstrate that the proposed G$^2$GAN achieves superior model capacity and better generation performance comparing with existing image-to-image translation GAN models.

研究の動機と目的

  • 各ドメインペアに対して複数のモデルをトレーニングする必要がある従来の非対応画像間翻訳手法におけるスケーラビリティとモデルクラッシュの問題を解決すること。
  • 翻訳と再構築のタスクを1つの生成器で共有するのではなく、2つの専用生成器を用いることで、翻訳と再構築のタスクを分離し、トレーニングの安定性と生成品質を向上させること。
  • 大規模なドメイン数に対しても、モデル数を Θ(m²) から1つに削減することで、1つのモデルで効率的なマルチドメイン翻訳を可能にすること。
  • 色のサイクル整合性、マルチスケール SSIM、アイデンティティ損失といった複数の最適化損失を統合的に探索・統合し、トレーニングの安定性と画像忠実度を向上させること。

提案手法

  • G2GAN は2つの異なる生成器を採用する:翻訳生成器 Gᵗ は、ターゲットドメインラベル zᵧ を用いて、ソースドメイン X の画像をターゲットドメイン Y にマッピングする。再構築生成器 Gʳ は、元のラベル zₓ を用いて、生成された画像を元のドメイン X に再マッピングする。
  • 2つの生成器は共有ディスクリミネータを介して共同でトレーニングされ、敵対的トレーニングを可能にしつつ、タスク固有のネットワークアーキテクチャとパラメータ共有レベルを維持する。
  • 色のサイクル整合性損失を導入し、翻訳および再構築経路間で色分布を保存することで、視覚的忠実度を向上させる。
  • マルチスケール SSIM とアイデンティティ損失を統合し、構造的一致性を向上させるとともに、顔画像翻訳タスクにおけるアイデンティティ特徴の保持を強化する。
  • 完全共有、部分共有、共有なしの3つの柔軟なパラメータ共有戦略をサポートし、モデル容量とパフォーマンスのトレードオフを可能にする。
  • 敵対的損失、サイクル整合性損失、知覚損失を統合した共同最適化目的関数を用いて、エンドツーエンドでトレーニングすることで、トレーニングの安定性を高め、モードクラッシュを軽減する。

実験結果

リサーチクエスチョン

  • RQ1二重生成器を備えた単一モデルアーキテクチャが、従来のマルチモデルや共有生成器アプローチを上回るパフォーマンスを発揮できるか?
  • RQ2翻訳と再構築を1つの生成器で共有するのではなく、別々の生成器に分離することで、StarGAN などの共有生成器モデルに比べてトレーニングの安定性と生成品質が向上するか?
  • RQ3色のサイクル整合性、SSIM、アイデンティティ損失といった異なる最適化損失が、G2GAN フレームワークのパフォーマンスと安定性に与える影響は何か?
  • RQ42つの生成器間のパラメータ共有レベルを変化させた場合、モデル容量と生成品質にどのような影響があるか?
  • RQ5G2GAN は、顔、風景、建築物といった多様なドメインにおいて、1つの統合モデルで最先端のパフォーマンスを達成できるか?

主な発見

  • G2GAN は、Facades、AR、Bu3dfe データセットで最高の FID スコアを達成し、ラベルから写真への翻訳で 23.6%、写真からラベルへの翻訳で 55.625% のターカー正答率を示し、StarGAN や他のベースラインを上回る。
  • アブレーションスタディでは、アイデンティティ損失を削除した場合(All - I)の正答率が 2.6% および 4.2% に低下し、アイデンティティ保持にその重要性が示された。
  • 二重ディスクリミネータを備えたバージョン(All - D)は、9.0% および 5.3% のターカー正答率を達成し、完全モデルに比べて安定性が向上したが、他の損失と組み合わせると性能が低下した。
  • G2GAN は、CycleGAN(52.6M×21)、DualGAN(178.7M×21)、StarGAN(53.2M×1)に比べて顕著に少ないパラメータ数(53.2M~61.6M)を用いながら、同等または優れたパフォーマンスを達成した。
  • 完全な G2GAN モデルは、ラベルから写真への翻訳で 10.3%、AR データセットで 22.8% のターカー正答率を達成し、多様なドメインにわたる強力なパフォーマンスを示した。
  • パラメータ共有なしのモデル(G2GAN no-sharing)は 61.6M パラメータで、AR データセットで 2.1% のターカー正答率を示したが、パラメータ共有が性能に不可欠であることが示されたものの、依然として競争力のある性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。