Skip to main content
QUICK REVIEW

[論文レビュー] Triple consistency loss for pairing distributions in GAN-based face synthesis

Enrique Sánchez, Michel Valstar|arXiv (Cornell University)|Nov 8, 2018
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 14
ひとこと要約

本稿では、GANベースの顔合成における分布不一致を解消するため、三重一貫性損失を提案する。この手法により、ネットワークの通過回数に関わらず一貫した出力を保証する。直接的および複数ステップの生成経路間の同等性を強制することで、信頼性のある段階的画像変換を実現し、顔のランドマークをガイドとする新規な顔合成モデル(GANnotation)を提案。このモデルは、多様なポーズや表情下でも高精細かつアイデンティティを保持した結果を達成する。

ABSTRACT

Generative Adversarial Networks have shown impressive results for the task of object translation, including face-to-face translation. A key component behind the success of recent approaches is the self-consistency loss, which encourages a network to recover the original input image when the output generated for a desired attribute is itself passed through the same network, but with the target attribute inverted. While the self-consistency loss yields photo-realistic results, it can be shown that the input and target domains, supposed to be close, differ substantially. This is empirically found by observing that a network recovers the input image even if attributes other than the inversion of the original goal are set as target. This stops one combining networks for different tasks, or using a network to do progressive forward passes. In this paper, we show empirical evidence of this effect, and propose a new loss to bridge the gap between the distributions of the input and target domains. This "triple consistency loss", aims to minimise the distance between the outputs generated by the network for different routes to the target, independent of any intermediate steps. To show this is effective, we incorporate the triple consistency loss into the training of a new landmark-guided face to face synthesis, where, contrary to previous works, the generated images can simultaneously undergo a large transformation in both expression and pose. To the best of our knowledge, we are the first to tackle the problem of mismatching distributions in self-domain synthesis, and to propose "in-the-wild" landmark-guided synthesis. Code will be available at https://github.com/ESanchezLozano/GANnotation

研究の動機と目的

  • GANベースの顔合成において、複数回のネットワーク通過を伴う際の分布一貫性を維持するための自己一貫性損失の失敗を解消すること。
  • 出力安定性が経路長に依存しないように保証することで、複数の属性変換を段階的に適用する画像変換を可能にすること。
  • 入力と出力のドメイン間の分布ギャップを埋め、最小限の監督下で制約のないポーズおよび表情変動をサポートする、新規なランドマークガイドド顔合成フレームワーク(GANnotation)の開発。
  • アイデンティティ保持顔変換における入力ドメインとターゲットドメイン間の分布ギャップを是正し、生成画像の一般化性能および再利用可能性を向上させること。
  • 現在の自己一貫性ベースのモデルが、生成画像をさらに変換するために再利用する際、外観が写真のようにリアルであっても失敗することを実証すること。

提案手法

  • あるターゲットに対して、経路が直接的か中間ステップを経由するかに関わらず、出力が同一であることを強制する三重一貫性損失を提案する。
  • 一歩でターゲットに到達するルートと、中間属性経由で到達する二歩ルートの出力間の距離を最小化することで、損失を定式化する。
  • 自己一貫性損失と組み合わせることで、アイデンティティの保持と分布シフトの安定化を両立させる。
  • 合成に際し、ターゲット顔面キーポoin配置のヒートマップを条件入力として使用するランドマークガイドド GAN である GANnotation を設計する。
  • 三重一貫性損失と自己一貫性損失の両方を用いて、入力画像をターゲットランドマークにマッピングする生成器を訓練し、アイデンティティと写真的リアリズムを維持する。
  • 推論時に、形状モデルを用いて平面内回転および視点角度を操作し、多様なポーズと表情の生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1なぜ現在の GAN ベースの顔合成モデルは、写真的リアリズムな出力を生成しても、自身の出力を再利用して段階的属性変換を実行する際に失敗するのか?
  • RQ2複数回のネットワーク通過が適用される際、自己一貫性損失が入力ドメインとターゲットドメイン間の分布一貫性をどの程度失敗させるのか?
  • RQ3三重一貫性損失は、異なる変換経路を経る生成画像の分布を効果的に安定化させ、信頼性のある段階的合成を可能にするのか?
  • RQ4ランドマークガイドド GAN(GANnotation)は、顔の大きなポーズおよび表情変化下でも、アイデンティティをどれほど効果的に保持し、リアルな顔を生成できるのか?
  • RQ5ターゲットランドマークが真値の顔面構造から著しく逸脱した場合、ランドマークガイドド合成の失敗モードはどのようなものか?

主な発見

  • 実証的証拠から、StarGAN などの自己一貫性ベースのモデルが、入力がわずかに変更された場合でも、自身の出力を再利用して属性を正しく生成できないことが示された。
  • 三重一貫性損失は段階的画像変換を効果的に可能にした:三重一貫性損失で訓練されたモデルでは、「黒髪」から「金髪」への変換が正しく実行されたが、標準的な自己一貫性損失では失敗した。
  • GANnotation は、低解像度入力やきついクロッピング下でも写真的リアリズムの顔画像を生成し、定量的および定性的な両面で CR-GAN を上回った。
  • ターゲットランドマークが現実的で、入力顔面構造とよく整合している場合、多様なポーズや表情下でもアイデンティティの一貫性が維持された。
  • ターゲットランドマークが極端であるか、入力顔面幾何と整合しない場合、ネットワークはアイデンティティの保持よりもランドマーク配置を優先し、より現実的でない、あるいは性別に一貫性のない顔が生成された。
  • 自己一貫性損失を除去するとアイデンティティ保持性能が劣化したため、両損失が不可欠であることが示された:三重一貫性損失は分布安定性を、自己一貫性損失はアイデンティティ保持をそれぞれ担う。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。