Skip to main content
QUICK REVIEW

[論文レビュー] HifiFace: 3D Shape and Semantic Prior Guided High Fidelity Face Swapping

Yuhan Wang, Xu Chen|arXiv (Cornell University)|Jun 18, 2021
Face recognition and analysis参考文献 23被引用数 8
ひとこと要約

HifiFaceは、3次元形状に配慮したアイデンティティ監視と、意味的顔面統合(SFF)モジュールを活用したエンドツーエンドの深層学習フレームワークを提案する。このアプローチにより、ソース顔の形状を保持し、写真のようにリアルな結果を生成する高精細な顔交換が実現される。3次元可塑的モデル(3DMM)の幾何学的特徴とアイデンティティ特徴、適応的特徴ブレンドを統合することで、野生の顔画像において、アイデンティティ保持とリアルさの両面で最先端の性能を達成する。

ABSTRACT

In this work, we propose a high fidelity face swapping method, called HifiFace, which can well preserve the face shape of the source face and generate photo-realistic results. Unlike other existing face swapping works that only use face recognition model to keep the identity similarity, we propose 3D shape-aware identity to control the face shape with the geometric supervision from 3DMM and 3D face reconstruction method. Meanwhile, we introduce the Semantic Facial Fusion module to optimize the combination of encoder and decoder features and make adaptive blending, which makes the results more photo-realistic. Extensive experiments on faces in the wild demonstrate that our method can preserve better identity, especially on the face shape, and can generate more photo-realistic results than previous state-of-the-art methods.

研究の動機と目的

  • 2次元ランドマークやテクスチャのみに依存する既存手法が、安定的にソース顔の形状を保持できない課題に対処する。
  • 一元的なエンドツーエンドフレームワーク内で、照明、遮蔽、背景の一貫性の問題を解決することで、写真的リアリズムを向上させる。
  • 形状の違いがある場合に顔の幾何学的特徴を適切に転送できないブレンドベース手法の制限を克服する。
  • アイデンティティを保持しつつ、表情、ポーズ、照明などのターゲット属性に適応する、同時特徴および画像レベルの統合メカニズムを開発する。

提案手法

  • ソースおよびターゲット顔の3DMM係数を統合することで、形状に配慮したアイデンティティベクトルを生成する3次元形状に配慮したアイデンティティ抽出器を導入する。これにより、顔の形状に対する幾何的監視が可能になる。
  • 3次元顔再構築モデルを用いて、ソースおよびターゲット顔の両方の3DMM係数を回帰し、それらを再結合することで、監視用の形状に配慮した表現を構築する。
  • 学習された顔マスクを用いて低レベルのエンコーダーおよびデコーダー特徴を適応的に統合する、意味的顔面統合(SFF)モジュールを提案する。これにより、テクスチャおよび属性の一貫性が向上する。
  • 適応的ブレンドマスクの生成を監視するため、拡張された顔セマンティックセグメンテーションヘッドを採用し、頑健なエッジブレンドと遮蔽処理を実現する。
  • アイデンティティ損失、形状損失、知覚的損失を組み合わせたマルチ損失最適化を用いてエンドツーエンド学習を実施し、アイデンティティの忠実性とリアルさのバランスを取る。
  • SFFモジュールから予測されたマスクを最終ブレンドに使用することで、ターゲット画像のマスクに依存せず、ゴースト効果やアーチファクトを低減する。

実験結果

リサーチクエスチョン

  • RQ12次元ランドマークや認識ベースの手法と比較して、3次元幾何的監視が顔の形状保持に顕著に寄与するか?
  • RQ2特徴および画像レベルでの学習可能で適応的な統合メカニズムが、ソースアイデンティティを維持しながら写真的リアリズムを向上させるか?
  • RQ3形状の不一致や遮蔽に対処する際、提案されたSFFモジュールは、標準的なブレンドや連結処理と比較してどのように優れているか?
  • RQ43次元形状に配慮したアイデンティティベクトルは、標準的なアイデンティティベクトルと比較して、形状誤差をどの程度低減するか?

主な発見

  • HifiFaceは、比較対象のすべての手法と比較して、顔の形状誤差(アイデンティティ係数のL2距離)が最小であり、大規模な形状変動下でも95%のサンプルでFaceShifterを下回る形状誤差を示した。
  • FF++およびDFDCデータセットにおいて、最先端の手法を上回り、顔偽造検出ベンチマークで最高のリアルさスコアを達成した。
  • アブレーションスタディの結果、SFFモジュールが画像品質および属性の一貫性を顕著に向上させ、アーチファクトと背景の不一致を低減することが確認された。
  • 3次元形状に配慮したアイデンティティコンponentは不可欠である:これを除去すると顕著な形状歪みとアーチファクトが発生し、幾何的忠実性の維持に果たす役割が裏付けられた。
  • SFFモジュールにより、形状転送時の顔の境界部で効果的なインpaintingが可能であることが、差分特徴マップから形状遷移領域におけるアーチファクトの低減が明確に示された。
  • HifiFaceはFaceShifterよりも高速でありながら、高い生成品質を維持しており、野生の顔画像において効率性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。