Skip to main content
QUICK REVIEW

[論文レビュー] Fast Face-swap Using Convolutional Neural Networks

Iryna Korshunova, Wenzhe Shi|arXiv (Cornell University)|Nov 29, 2016
Generative Adversarial Networks and Image Synthesis参考文献 29被引用数 9
ひとこと要約

この論文では、ポーズ、表情、照明を保持しながらアイデンティティを転送するリアルタイムでフォワードプロパゲーション型の畳み込みニューラルネットワークを提案する。複数枚のスタイル損失と照明に配慮した損失関数を導入することで、1枚のターゲットアイデンティティの参照画像と、アライメント以外のユーザー入力が不要な状態で、高いリアルリズムとほぼリアルタイムの推論を達成する。

ABSTRACT

We consider the problem of face swapping in images, where an input identity is transformed into a target identity while preserving pose, facial expression, and lighting. To perform this mapping, we use convolutional neural networks trained to capture the appearance of the target identity from an unstructured collection of his/her photographs.This approach is enabled by framing the face swapping problem in terms of style transfer, where the goal is to render an image in the style of another one. Building on recent advances in this area, we devise a new loss function that enables the network to produce highly photorealistic results. By combining neural networks with simple pre- and post-processing steps, we aim at making face swap work in real-time with no input from the user.

研究の動機と目的

  • ポーズ、表情、照明を保持しながらアイデンティティを転送する完全自動でリアルタイムの顔交換を可能にすること。
  • 従来の手法が手動によるアライメント、多数のユーザー入力、または大規模な画像コレクションを必要としているという制限を克服すること。
  • 新しい損失関数を用いて訓練されたフォワードプロパゲーション型ニューラルネットワークを用いてフォトリアルな結果を達成すること。
  • 顔交換をスタイル転送問題として定式化し、ニューラルスタイル転送をフォトリアルな顔画像に拡張すること。
  • 最小限の計算コストで推論を行う単一画像入力に対して、アイデンティティ転送を実用的かつスケーラブルにすること。

提案手法

  • 本手法は、入力顔のコンテンツをターゲット人物のアイデンティティに変換するマルチスケールのフォワードプロパゲーション型畳み込みニューラルネットワークを用いる。
  • ターゲットアイデンティティの外見を単一の参照画像に依存するのではなく、多様体としてモデル化する、新しいマルチイメージスタイル損失を導入する。
  • 追加の照明に配慮した損失成分を導入し、入力画像と生成画像間の照明の一貫性を保証する。
  • 顔のアライメントおよび再アライメントには、顔のキーポoin検出とアフィン変換を用い、幾何学的一致性を維持する。
  • 後処理では、学習されたセグメンテーションマスクを用いて、交換された顔を元の画像に滑らかに合成する。
  • ネットワークは、コンテンツおよびスタイルの特徴としてVGG-19の特徴量を用い、L2損失と知覚的損失の組み合わせによりリアルリズムを維持する。

実験結果

リサーチクエスチョン

  • RQ1フォワードプロパゲーション型ニューラルネットワークは、最小限のユーザー入力でリアルタイムにフォトリアルな顔交換を達成できるか?
  • RQ2スタイル転送技術は、ポーズ、表情、照明を保持しながらアイデンティティを保持するようにどのように適応できるか?
  • RQ3どのような損失関数設計により、ターゲットアイデンティティの参照画像のコレクションのみを用いて高精細な顔交換が可能になるか?
  • RQ4複数枚のスタイル損失は、単一参照スタイル転送と比較して、リアルリズムと耐性を向上させられるか?
  • RQ5照明に配慮した損失の導入は、生成された顔交換画像における一貫性をどのように向上させるか?

主な発見

  • 提案手法はほぼリアルタイムの推論を達成し、低遅延でインタラクティブまたは動画ベースの顔交換が可能である。
  • マルチイメージスタイル損失は、ターゲットアイデンティティの外見を単一の画像ではなく分布としてモデル化することで、リアルリズムを顕著に向上させる。
  • 照明に配慮した損失成分の導入により、生成画像における不自然な照明の変化が低減される。
  • 結果として、顔の表情、視線、ポーズでさえも、厳しい照明条件下でも顕著に保持された高フォトリアルな結果が得られた。
  • 特に複雑な顔の構造やテクスチャを扱う際、従来のスタイル転送アプローチを上回る性能を示した。
  • 制限事項として、覆われた顔(例:メガネ)にアーティファクトが生じやすく、極端なポーズでは性能が劣り、一部のケースで過剰に滑らかになることがある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。