Skip to main content
QUICK REVIEW

[論文レビュー] EDIT: Exemplar-Domain Aware Image-to-Image Translation

Yuanbin Fu, Jiayi Ma|arXiv (Cornell University)|Nov 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 32被引用数 5
ひとこと要約

この論文では、任意の例示画像を用いて、複数のドメインにまたがる制御可能で多様性に富み、高精細な画像対画像翻訳を実現する統合型生成的敵対ネットワークであるEDITを提案する。共有特徴抽出器と、例示画像およびドメインに依存するパラメータ生成器を組み合わせることで、先行手法と比較してモデルサイズと推論時間を顕著に削減しながら、定量的指標および定性的な結果の両面で最先端の性能を達成している。

ABSTRACT

Image-to-image translation is to convert an image of the certain style to another of the target style with the content preserved. A desired translator should be capable to generate diverse results in a controllable (many-to-many) fashion. To this end, we design a novel generative adversarial network, namely exemplar-domain aware image-to-image translator (EDIT for short). The principle behind is that, for images from multiple domains, the content features can be obtained by a uniform extractor, while (re-)stylization is achieved by mapping the extracted features specifically to different purposes (domains and exemplars). The generator of our EDIT comprises of a part of blocks configured by shared parameters, and the rest by varied parameters exported by an exemplar-domain aware parameter network. In addition, a discriminator is equipped during the training phase to guarantee the output satisfying the distribution of the target domain. Our EDIT can flexibly and effectively work on multiple domains and arbitrary exemplars in a unified neat model. We conduct experiments to show the efficacy of our design, and reveal its advances over other state-of-the-art methods both quantitatively and qualitatively.

研究の動機と目的

  • 決定論的で一対一の画像対画像翻訳の制限を克服し、統合フレームワーク内で多対多、例示画像に制御された翻訳を可能にすること。
  • 複数のドメインにまたがる高品質で多様な出力を維持しながら、モデルサイズと推論時間を削減すること。
  • 動的パラメータ生成を用いて、1つのジェネレータアーキテクチャ内でドメインに依存するスタイルモデリングと例示画像に依存するスタイルモデリングを統合すること。
  • サイクル整合性と敵対的訓練を通じて、コンテンツの忠実性を保持し、分布の現実性を確保すること。
  • 複数の例示画像からの動的パラメータを線形結合することで、滑らかなスタイル補間を実現すること。

提案手法

  • ジェネレータは、すべてのドメインにわたるコンテンツ特徴抽出のための共有畳み込みブロックを用い、一貫した表現を保証する。
  • 動的パラメータ生成器が、ドメインおよび例示画像に特化した重みをスタイリングブロックに生成し、パーソナライズされたスタイル転送を可能にする。
  • モデルは、ドメイン間を往復する翻訳においてもコンテンツを保持するため、サイクル整合性損失を採用する。
  • 敵対的ディスクラミネータが、生成画像がターゲットドメインの分布と一致することを保証する。
  • 動的パラメータは、例示画像およびドメインIDを条件として、軽量なパラメータネットワークによって生成される。
  • フレームワークは、1つのコンactなモデル内で任意の例示画像と複数のドメインをサポートする。

実験結果

リサーチクエスチョン

  • RQ1統合モデルは、任意の例示画像を用いて、複数のドメインにまたがる高品質で多様な画像対画像翻訳を達成できるか?
  • RQ2動的パラメータ生成は、効率的にドメイン固有および例示画像固有のスタイル情報をモデリングするためにどのように利用できるか?
  • RQ3敵対的訓練とサイクル整合性は、少数の例示画像に基づく翻訳において、コンテンツの保持と現実性にどのような影響を与えるか?
  • RQ4提案手法は、既存の最先端の例示ベースおよびマルチドメイン翻訳モデルと比較して、効率性と性能でどのように優れているか?
  • RQ5複数の例示画像からの動的パラメータを線形結合することで、滑らかなスタイル補間が達成できるか?

主な発見

  • EDITは、複数のベンチマークで最先端のFIDスコアを達成し、cityscapesデータセットでは12.4、horse2zebraデータセットでは18.7を記録し、先行手法を上回った。
  • 効率的な動的パラメータ生成のおかげで、ストレージ要件が476MBにまで削減され、metaNSTの870MBと比べ顕著に低減した。
  • 1枚あたりの推論速度は4.3msであり、例示画像に依存する手法の中で最も速く、cycleGANの3.5msにわずかに劣るのみであった。
  • 視覚的結果では、特に例示画像を用いた絵画から写真への翻訳のような複雑なケースにおいて、優れたコンテンツ保持と現実的なスタイリングが確認された。
  • 動的パラメータの線形結合によるスタイル補間により、スタイル間の滑らかで視覚的に整合性のある遷移が得られた。
  • アブレーションスタディの結果、ディスクラミネータとサイクル整合性の重要性が確認され、いずれの要素を削除すると性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。