Skip to main content
QUICK REVIEW

[論文レビュー] UGAN: Untraceable GAN for Multi-Domain Face Translation

Defa Zhu, Si Liu|arXiv (Cornell University)|Jul 26, 2019
Generative Adversarial Networks and Image Synthesis参考文献 49被引用数 14
ひとこと要約

UGANは、元画像の特徴が残存する問題に取り組むために、残留する元ドメイン特徴を検出するためのソース分類器と、ターゲット固有の属性を強制するためのターゲットプロトタイプインジェクション機構を導入した、未追跡可能なGANフレームワークを提案する。この手法は、顔の年齢変更、化粧変更、表情編集において、StarGANなどの最先端モデルを大きく上回り、FIDスコアが低く、ユーザーの好みも高いという優れたリアルリズムとドメイン固有の忠実性を達成している。

ABSTRACT

The multi-domain image-to-image translation is a challenging task where the goal is to translate an image into multiple different domains. The target-only characteristics are desired for translated images, while the source-only characteristics should be erased. However, recent methods often suffer from retaining the characteristics of the source domain, which are incompatible with the target domain. To address this issue, we propose a method called Untraceable GAN, which has a novel source classifier to differentiate which domain an image is translated from, and determines whether the translated image still retains the characteristics of the source domain. Furthermore, we take the prototype of the target domain as the guidance for the translator to effectively synthesize the target-only characteristics. The translator is learned to synthesize the target-only characteristics and make the source domain untraceable for the discriminator, so that the source-only characteristics are erased. Finally, extensive experiments on three face editing tasks, including face aging, makeup, and expression editing, show that the proposed UGAN can produce superior results over the state-of-the-art models. The source code will be released.

研究の動機と目的

  • 複数ドメイン間の画像対画像翻訳において、翻訳画像が互換性のない元ドメインの特徴を保持する現象を特定・解決すること。
  • 例えばヒゲやしわといったソース固有の特徴を明示的に消去し、滑らかな肌や大きな目といったターゲット固有の特徴を正確に合成するメカニズムを開発すること。
  • 翻訳された画像にまだ元ドメインの痕跡が残っているかどうかを検出できるように、識別器内にソース分類器を導入し、ターゲット最適化を可能にすること。
  • 顔の構造やテクスチャといったターゲットドメイン固有の属性を忠実に合成するために、ドメインプロトタイプを用いてトランスレーターをガイドすること。
  • 顔の年齢変更、化粧編集、表情編集という3つの顔編集タスクにおいて、UGANの有効性を実証すること。

提案手法

  • 生成された画像の元ドメインを特定するためのソース分類器を識別器内に訓練し、残留する元ドメイン特徴の検出を可能にする。
  • 生成器はソース分類器を欺くように最適化され、元ドメインが追跡不能になるようにすることで、ソース固有の特徴の完全な消去を促進する。
  • ターゲットドメインのプロトタイプ(例:子供の顔の丸み)といった、重要な属性の統計的表現を抽出し、生成器にインジェクションしてターゲット固有の特徴の合成をガイドする。
  • 敵対的損失、サイクル整合性、およびプロトタイプガイド付き再構成を組み合わせたマルチ損失目的関数を用いて生成器を訓練することで、忠実性とドメイン固有性を確保する。
  • 二重識別器構造を採用:一方はドメイン分類、もう一方は元ドメインの追跡。これにより最適化の分離が可能になる。
  • プロトタイプインジェクションは、生成器のスキップ接続における特徴レベルのモodulationによって実装され、生成された特徴がターゲットドメインの統計と一致するように調整される。

実験結果

リサーチクエスチョン

  • RQ1元ドメイン分類器が失敗するような状況でも、ソース分類器は翻訳画像に残留する元ドメイン特徴を効果的に検出できるか?
  • RQ2元ドメインの隠蔽による未追跡トレーニングによって、複数ドメイン顔翻訳における元ドメイン特徴の保持はどの程度軽減されるか?
  • RQ3プロトタイプインジェクションは、顔の構造やテクスチャといったターゲットドメイン固有の特徴の合成をどの程度改善するか?
  • RQ4提案されたUGANフレームワークは、顔の年齢変更、化粧変更、表情編集という多様な顔編集タスクにおいて、定量的指標と人間評価の両面でStarGANなどの最先端モデルを上回るか?
  • RQ5UGANフレームワークは、顔編集を超えて、言語やスタイル変換などの他の画像翻訳タスクにも一般化可能か?

主な発見

  • CelebA-HQ顔の年齢変更データセットにおいて、UGANは平均イントラ-FIDが28.4を達成し、StarGANの44.8よりも顕著に低く、画像品質とドメインの一貫性に優れていることを示している。
  • Amazon Mechanical Turkを用いたユーザー研究において、UGANは0〜10歳の年齢グループへの顔変換において86.8%のケースでStarGANを上回り、よりリアルな子供の外見に対する強い好みが示された。
  • 全年齢グループのギャップにおいて、UGANでは元画像と翻訳画像の特徴間のコサイン類似度が一貫して低く抑えられており、元特徴のより効果的な消去が確認された。
  • 定性的な結果では、UGANは子供の年齢変換においてヒゲやしわを効果的に除去し、自然な化粧や表情の変化を生成した一方、StarGANは元の特徴を保持していた。
  • MAKEUP-A5データセットでは、UGANが非対称性や不自然なテクスチャが見られるStarGANの出力と比較して、より自然なチークやアイシャドーの分布を生成した。
  • 表情編集においては、UGANは「喜びを伴う驚き」や「喜び」のような複合的・基本的表現の微細な違いを正確に捉えており、StarGANは元の表情(例:ぎゅっとしわが寄った眉)を保持していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。