Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Image-to-Image Translation

Jianxin Lin, Yingce Xia|arXiv (Cornell University)|May 1, 2018
Generative Adversarial Networks and Image Synthesis参考文献 22被引用数 19
ひとこと要約

本論文では、条件付きGANとデュアル学習を用いて、ターゲットドメインの画像に条件付けすることで翻訳結果の細かい制御を可能にする、条件付き画像間翻訳を提案する。この手法はドメインに依存しない特徴量とドメインに特有の特徴量を分離し、多様で制御可能な出力を可能にする。ユーザー研究による検証を経て、顔同士やエッジから靴/バッグへの翻訳タスクにおいて優れた結果を示した。

ABSTRACT

Image-to-image translation tasks have been widely investigated with Generative Adversarial Networks (GANs) and dual learning. However, existing models lack the ability to control the translated results in the target domain and their results usually lack of diversity in the sense that a fixed image usually leads to (almost) deterministic translation result. In this paper, we study a new problem, conditional image-to-image translation, which is to translate an image from the source domain to the target domain conditioned on a given image in the target domain. It requires that the generated image should inherit some domain-specific features of the conditional image from the target domain. Therefore, changing the conditional image in the target domain will lead to diverse translation results for a fixed input image from the source domain, and therefore the conditional input image helps to control the translation results. We tackle this problem with unpaired data based on GANs and dual learning. We twist two conditional translation models (one translation from A domain to B domain, and the other one from B domain to A domain) together for inputs combination and reconstruction while preserving domain independent features. We carry out experiments on men's faces from-to women's faces translation and edges to shoes&bags translations. The results demonstrate the effectiveness of our proposed method.

研究の動機と目的

  • 固定された入力に対して決定的でない出力を生成する既存の画像間翻訳モデルにおける制御性と多様性の欠如に対処すること。
  • ターゲットドメインからの参照画像に条件付けすることで、翻訳画像のスタイルを細かく制御可能にすること。
  • ソース画像のドメインに依存しない特徴量を保持すると同時に、条件付きターゲット画像からのドメイン特有の特徴量を移譲する手法の開発。
  • 対応のないデータを用いてGANとデュアル学習を適用し、再構成性とドメインの一貫性を保証することでこれを達成すること。

提案手法

  • モデルは2つの条件付き翻訳ネットワークを用いる:ドメインAからBへのものと、BからAへのもので、共通の特徴抽出バックボーンを共有する。
  • ドメインに依存しない特徴量とドメイン特有の特徴量は、ソース画像および条件付き画像のための別々のエンコーダーを介して分離される。
  • 生成された画像が現実的でかつターゲットドメインに属することを保証するため、条件付きGANに敵対的損失を適用して訓練する。
  • ドメインに依存しない特徴量およびドメイン特有の特徴量の両方の再構成損失を用いてデュアル学習を適用し、アイデンティティと構造を維持する。
  • 再構成精度と特徴量の一貫性を向上させるために、ドメイン特有の特徴量を生成器にスキップ接続を設ける。
  • 敵対的損失、サイクル一貫性損失、およびドメインに依存しない・ドメイン特有の両方の特徴量の再構成損失を組み合わせた損失関数を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1固定されたソース入力に対して、ターゲットドメインの画像に条件付けすることで、多様で制御可能な画像間翻訳結果を得られるか?
  • RQ2ドメインに依存しない特徴量とドメイン特有の特徴量は、画像翻訳において効果的に分離・操作可能か?
  • RQ3ペaired例のないデータを効果的に活用して、ペアのないデータで条件付き翻訳モデルを学習可能か?
  • RQ4スイッチ接続や特徴量再構成などのアーキテクチャ的要素は、高品質な条件付き翻訳に不可欠か?
  • RQ5視覚的品質とユーザーの好みの観点から、本手法は既存のGANベースおよびデュアル学習手法と比較して優れているか?

主な発見

  • 提案されたcd-GANモデルは、ベースラインモデル(cd-GAN-rec、cd-GAN-nofなど)を上回り、画像品質と特徴量の一貫性の両面で優れている。特にドメインに依存しない構造の保持において顕著である。
  • 17名の被験者を対象としたユーザー研究では、本手法で生成された画像が、他の手法と比較して条件付き画像のドメイン特有の特徴量に著しく類似していることが示された。
  • アブレーションスタディにより、スイッチ接続と特徴量再構成損失が高精細な画像再構成と特徴量の分離に不可欠であることが確認された。
  • モデルはドメイン特有の特徴量のみを用いても画像を生成でき、そのスタイルが条件付き画像に類似しており、効果的な特徴量抽出が実証された。
  • ドメインに依存しない特徴量のみを用いた場合、ソース画像の主要な形状が保持されていることから、構造的要因とスタイル要因の分離が成功していることが確認された。
  • 顔同士およびエッジから靴/バッグへの翻訳タスクにおける結果は、対称的・非対称的両方の翻訳設定において、本手法の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。