Skip to main content
QUICK REVIEW

[論文レビュー] Asymmetric GANs for Image-to-Image Translation

Hao Tang, Nicu Sebe|arXiv (Cornell University)|Dec 14, 2019
Generative Adversarial Networks and Image Synthesis参考文献 49被引用数 5
ひとこと要約

本稿では、画像対画像翻訳のための新しいGANフレームワークであるAsymmetricGANを提案する。このフレームワークは、翻訳タスクと再構築タスクにそれぞれ異なるサイズとアーキテクチャを持つ2つの非対称な生成器を用いる。タスク固有の要件に合わせてネットワーク設計を分離することで、モデル容量を削減しつつ、優れた画像品質と安定性を実現し、StarGAN や GestureGAN といった対称モデルを上回る性能を、教師ありおよび教師なしの翻訳タスクの両方で達成する。

ABSTRACT

Existing models for unsupervised image translation with Generative Adversarial Networks (GANs) can learn the mapping from the source domain to the target domain using a cycle-consistency loss. However, these methods always adopt a symmetric network architecture to learn both forward and backward cycles. Because of the task complexity and cycle input difference between the source and target domains, the inequality in bidirectional forward-backward cycle translations is significant and the amount of information between two domains is different. In this paper, we analyze the limitation of existing symmetric GANs in asymmetric translation tasks, and propose an AsymmetricGAN model with both translation and reconstruction generators of unequal sizes and different parameter-sharing strategy to adapt to the asymmetric need in both unsupervised and supervised image translation tasks. Moreover, the training stage of existing methods has the common problem of model collapse that degrades the quality of the generated images, thus we explore different optimization losses for better training of AsymmetricGAN, making image translation with higher consistency and better stability. Extensive experiments on both supervised and unsupervised generative tasks with 8 datasets show that AsymmetricGAN achieves superior model capacity and better generation performance compared with existing GANs. To the best of our knowledge, we are the first to investigate the asymmetric GAN structure on both unsupervised and supervised image translation tasks.

研究の動機と目的

  • 翻訳と再構築の複雑さや情報フローに差がある非対称な画像対画像翻訳タスクにおいて、対称GANの限界を解消すること。
  • 翻訳と再構築のための専用生成器を設計することで、モデル容量を削減しつつ生成品質を向上させること。
  • 非対称な構成要素に特化した最適化損失を用いることで、訓練の不安定性やモード崩壊を軽減すること。
  • 教師ありおよび教師なしの画像対画像翻訳ベンチマークの両方で、有効性を示すこと。

提案手法

  • 翻訳タスクに適した大きな生成器 $G^t$ と、変換出力から元の画像を再構築する小さな再構築生成器 $G^r$ の2つの異なる生成器を導入する。
  • $G^t$ と $G^r$ の最初の畳み込み層で異なるフィルタ数(64 対 4)を採用し、非対称なパラメータ共有とアーキテクチャの特化を可能にする。
  • 翻訳および再構築プロセスの両方に、ドメイン固有のガイド(例:ラベル $z_x$, $z_y$ またはハンドスケルトン $l_x$, $l_y$)を用いて条件づける。
  • 敵対的損失、サイクル整合性損失、および知覚損失を含む複数の損失関数を用いた共同最適化により、訓練の安定性と忠実度を向上させる。
  • $G^t$ と $G^r$ を独立して訓練するが、サイクル整合性を保つために共同で最適化する二重スレッドアーキテクチャを採用する。
  • 対称GANの「万能設計」を避けるために、タスクの非対称性を尊重するパラメータ共有戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1教師ありおよび教師なしの両設定において、非対称な生成器アーキテクチャは、対称な対応物に比べて画像対画像翻訳の性能を向上させることができるか?
  • RQ2翻訳と再構築のタスク間でモデル容量を分離することで、生成品質の向上とモデルサイズの削減が達成できるか?
  • RQ3提案された非対称設計は、GANにおけるモード崩壊の軽減と訓練の安定性向上にどのように寄与するか?
  • RQ4AsymmetricGANは、手のジェスチャー対ジェスチャー翻訳において、StarGAN や GestureGAN といった最先端モデルをどれほど上回るか?
  • RQ5非対称フレームワークは、ジェスチャー翻訳を越えた他の画像翻訳タスクにも一般化可能か?

主な発見

  • NTU Hand Digit データセットでは、再構築ブランチのパラメータ数を著しく削減しているにもかかわらず、AsymmetricGANはPSNR 32.6686を達成し、SymmetricGAN(32.5740)および GestureGAN(32.6091)を上回った。
  • Senz3D データセットでは、AsymmetricGANはPSNR 31.5624およびAMTスコア28.1を達成し、PG2、SAMG、DPIG、PoseGAN、GestureGANをすべて上回った。
  • NTU Hand Digit ではFIDスコア6.7132、Senz3D では12.4326を記録し、ベースラインと比較して優れた画像品質と分布整合性を示した。
  • AsymmetricGANは、合計パラメータ数を11.434M(SymmetricGANの22.776M)にまで削減しながら、PSNRおよびAMTを向上させ、効率性と有効性の両面で優れた性能を示した。
  • アブレーションスタディの結果、再構築生成器のパラメータ数を大幅に削減しても、非対称設計が性能向上に寄与することが確認された。
  • 定性的な結果では、特に複雑なジェスチャー翻訳タスクにおいて、他の比較手法と比較して、より写真的で詳細な画像を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。