Skip to main content
QUICK REVIEW

[論文レビュー] Reusing Discriminators for Encoding: Towards Unsupervised Image-to-Image Translation

Runfa Chen, Wenbing Huang|arXiv (Cornell University)|Feb 29, 2020
Generative Adversarial Networks and Image Synthesis参考文献 36被引用数 14
ひとこと要約

この論文は、生成器と識別器の両方で使用される識別器の初期層を、ターゲットドメイン用のプラグインエンコーダとして再利用することで、独立したエンコーダの必要性を排除する、新しい非教師あり画像対画像変換フレームワークNICE-GANを提案する。エンコーダの学習を生成器とは分離し、GANの adversarial loss のみで訓練することで、よりコン act で効果的なアーキテクチャを実現し、4つのデータセットにおいてFID、KID、人間の好みのベンチマークで最先端の性能を達成した。

ABSTRACT

Unsupervised image-to-image translation is a central task in computer vision. Current translation frameworks will abandon the discriminator once the training process is completed. This paper contends a novel role of the discriminator by reusing it for encoding the images of the target domain. The proposed architecture, termed as NICE-GAN, exhibits two advantageous patterns over previous approaches: First, it is more compact since no independent encoding component is required; Second, this plug-in encoder is directly trained by the adversary loss, making it more informative and trained more effectively if a multi-scale discriminator is applied. The main issue in NICE-GAN is the coupling of translation with discrimination along the encoder, which could incur training inconsistency when we play the min-max game via GAN. To tackle this issue, we develop a decoupled training strategy by which the encoder is only trained when maximizing the adversary loss while keeping frozen otherwise. Extensive experiments on four popular benchmarks demonstrate the superior performance of NICE-GAN over state-of-the-art methods in terms of FID, KID, and also human preference. Comprehensive ablation studies are also carried out to isolate the validity of each proposed component. Our codes are available at https://github.com/alpc91/NICE-GAN-pytorch.

研究の動機と目的

  • GANベースの画像変換フレームワークにおける識別器の役割を、分類を超えて再考すること。
  • 識別器の初期層をターゲットドメイン用の共有エンコーダとして再利用することで、独立したエンコーダの必要性を排除すること。
  • エンコーダが生成器と識別器の両方で共有される場合に生じる矛盾する勾配が引き起こす学習不安定性を解消すること。
  • 学習安定性とエンコーダ品質を向上させる、分離された学習戦略を開発すること。
  • 識別器によって学習されたエンコーダが、生成器によって学習されたものよりも情報量の多い特徴を抽出できることを示すこと。

提案手法

  • 識別器の初期畳み込み層を、ターゲットドメイン用の共有エンコーダとして再利用し、別個のエンコーダ部品の必要性を排除する。
  • 特徴表現力を向上させるためにマルチスケール識別器アーキテクチャを採用し、再利用されたエンコーダが自然にその利点を引き継ぐ。
  • エンコーダが生成器の学習中に更新されず、識別器の学習時(GANの損失を最大化するとき)にのみ更新される、分離された学習パラダイムを導入する。
  • 翻訳の忠実度を保つためにサイクル整合性と再構成損失を維持する一方で、エンコーダは adversarial 目的により独立して学習する。
  • 識別器の内部特徴を潜在表現として使用することで、共有パラメータを有するエンドツーエンドの学習が可能となり、モデルの複雑さが低減される。
  • エンコーダが翻訳を目的とせず、識別性能の向上を目的とするように変更されたGAN目的関数を採用することで、勾配の一貫性を確保する。

実験結果

リサーチクエスチョン

  • RQ1識別器の内部特徴は、非教師あり画像変換の意味のあるエンコーダとして効果的に再利用可能か?
  • RQ2識別器をエンコーダとして再利用することで、よりコン act で効率的なモデルアーキテクチャが実現可能か?
  • RQ3エンコーダの学習を生成器の学習から分離することで、学習安定性と性能にどのような影響を与えるか?
  • RQ4識別器ベースのエンコーダは、従来の別個のエンコーダよりも特徴品質と翻訳忠実度の面で優れているか?
  • RQ5マルチスケール識別器と共有層の影響は、フレームワーク全体の性能にどのような影響を与えるか?

主な発見

  • NICE-GANは4つのベンチマークデータセットにおいて最先端の性能を達成し、FID、KID、人間の好みの評価で既存手法を上回った。
  • 分離された学習戦略により、学習安定性と性能が顕著に向上し、NICE-GANはすべての指標でNICE-GAN-1(統合学習)およびNICE-GAN-2(逆方向の分離)を上回った。
  • マルチスケール識別器から最高スケールの特徴マップ($C^2_x$)を削除すると、性能が著しく低下し、特徴学習におけるその重要性が示された。
  • エンコーダ全体を生成器と識別器が共有すると最適な性能が得られ、共有層を減らすか増やすと性能が劣化した。
  • 生成器や識別器間でパラメータを共有する重みカップリング戦略は、顕著な性能劣化を引き起こし、提案された分離設計の優位性を強調した。
  • t-SNE可視化とMMD解析により、NICE-GANがベースラインと比較してより分離され、ドメインに整合した潜在表現を学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。