Skip to main content
QUICK REVIEW

[論文レビュー] TuiGAN: Learning Versatile Image-to-Image Translation with Two Unpaired Images

Jianxin Lin, Yingxue Pang|arXiv (Cornell University)|Apr 9, 2020
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 5
ひとこと要約

TuiGANは、2つの未対応画像のみを用いてトレーニングする1ショット非教師付き画像対画像変換モデルを提案する。粗い段階から細かい段階へと段階的に画像変換を改善する多スケールの生成的敵対ネットワークを用い、生成器と識別器の複数スケールのピラミッド構造を採用することで、段階的に高精度な変換を実現する。本手法は、多様なUI2Iタスクで最先端の性能を達成しており、大規模データセットでトレーニングされたモデルですら、1ショットの状況下でそれを上回る性能を示している。

ABSTRACT

An unsupervised image-to-image translation (UI2I) task deals with learning a mapping between two domains without paired images. While existing UI2I methods usually require numerous unpaired images from different domains for training, there are many scenarios where training data is quite limited. In this paper, we argue that even if each domain contains a single image, UI2I can still be achieved. To this end, we propose TuiGAN, a generative model that is trained on only two unpaired images and amounts to one-shot unsupervised learning. With TuiGAN, an image is translated in a coarse-to-fine manner where the generated image is gradually refined from global structures to local details. We conduct extensive experiments to verify that our versatile method can outperform strong baselines on a wide variety of UI2I tasks. Moreover, TuiGAN is capable of achieving comparable performance with the state-of-the-art UI2I models trained with sufficient data.

研究の動機と目的

  • 1枚の画像しか利用できない極めて少ないデータ環境下での非教師付き画像対画像変換(UI2I)を解決すること。
  • 対応データや大量の未対応データを必要としない、多様なUI2Iを実現するモデルを開発すること。
  • テクスチャや色のパターンだけでなく、スタイルと高レベルの意味的コンテンツの両方を転送できる変換を可能にすること。
  • 1ショット学習でも、大規模データセットでトレーニングされたモデルと同等の性能を達成できることを示すこと。

提案手法

  • TuiGANは、複数スケールの条件付きGANの2つのピラミッドを採用し、生成器と識別器がスケールごとに配置され、グローバルな構造からローカルな詳細へと画像を段階的に精錬する。
  • 各スケールでは、前のスケールからの特徴を組み合わせ、スケールに適応した注目メカニズムを用いて多スケール表現を統合する生成器が使用される。
  • コンテンツの保存とアーティファクトの低減を目的として、サイクル整合性損失、アイデンティティ損失、全変動損失をモデルが用いる。
  • 各スケールの生成器は段階的に画像を精錬し、スケイプ接続と注目モジュールを通じて高レベルの特徴が低レベルの詳細を指導する。
  • 各スケールの識別器は、元のソースドメインおよびターゲットドメインの実画像と、その解像度での生成画像を区別する。
  • アーキテクチャにより、スケール間で受容 field を変化させることで、最小限のデータでドメインの分布シフトを捉えるプログレッシブな変換が可能になる。

実験結果

リサーチクエスチョン

  • RQ12つの未対応画像(それぞれのドメイン1枚ずつ)のみで、非教師付き画像対画像変換を効果的に行うことは可能か?
  • RQ2粗い段階から細かい段階へと進む多スケールのGANアーキテクチャは、1ショット設定下でより優れた特徴学習と翻訳の忠実度を実現できるか?
  • RQ3最小限のデータで、低レベルのスタイル(例:色、テクスチャ)と高レベルの意味的コンテンツ(例:物体の形状、構造)を同時に転送できるか?
  • RQ4サイクル損失、アイデンティティ損失、注目メカニズムといった主要な構成要素が、1ショット変換における性能にどのように影響を与えるか?
  • RQ52枚の画像でのみトレーニングされたモデルが、大規模データセットでトレーニングされたモデルと同等の性能を達成できるか?

主な発見

  • TuiGANは、horse↔zebra、facade↔labels、aerial maps↔mapsといった1ショット画像対画像変換タスクで、強力なベースラインを上回る性能を示した。
  • horse↔zebraタスクにおいて、TuiGANはSIFIDスコア1.03×10⁻⁴、PDスコア6.16を達成し、すべてのバリエーションの中で最低であり、高精細さとコンテンツの保存性の両面で優れた性能を示した。
  • アブレーションスタディの結果、サイクル整合性損失やアイデンティティ損失を削除すると顕著なアーティファクトや色の不正確さが生じ、これらが重要であることが確認された。
  • N=4スケールの完全なモデルが最良の性能を達成したが、N=0(CycleGANに相当)ではグローバル構造の保存が不十分で、アーティファクトが顕著に現れた。
  • 絵画から画像への変換タスクにおいて、TuiGANはPhotoWCT、FUNIT、SinGANよりもより正確で詳細な結果を生成し、コンテンツの保存と繊細なスタイルパターンの転送を両立した。
  • わずか2枚の画像でのみトレーニングされたにもかかわらず、TuiGANは大規模データセットでトレーニングされた最先端モデルと同等の性能を達成しており、極めて少ないデータ環境下での優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。