Skip to main content
QUICK REVIEW

[論文レビュー] One-Shot Identity-Preserving Portrait Reenactment

Sitao Xiang, Yuming Gu|arXiv (Cornell University)|Apr 26, 2020
Generative Adversarial Networks and Image Synthesis参考文献 61被引用数 8
ひとこと要約

本論文は、1枚のターゲット画像とドライビング対象動画の2次元顔ランドマークを用いて、ワンショットでアイデンティティを保持するポートレート再現手法を提案する。ランドマークの分離ネットワーク(LD-Net)を導入し、アイデンティティをポーズ・表情から分離するとともに、特徴辞書に基づくGAN(FD-GAN)を用いて写真並みのリアルなポートレートを合成することで、最先端の手法と比較して顕著なアイデンティティ保持性と未学習対象への一般化性能を達成した。

ABSTRACT

We present a deep learning-based framework for portrait reenactment from a single picture of a target (one-shot) and a video of a driving subject. Existing facial reenactment methods suffer from identity mismatch and produce inconsistent identities when a target and a driving subject are different (cross-subject), especially in one-shot settings. In this work, we aim to address identity preservation in cross-subject portrait reenactment from a single picture. We introduce a novel technique that can disentangle identity from expressions and poses, allowing identity preserving portrait reenactment even when the driver's identity is very different from that of the target. This is achieved by a novel landmark disentanglement network (LD-Net), which predicts personalized facial landmarks that combine the identity of the target with expressions and poses from a different subject. To handle portrait reenactment from unseen subjects, we also introduce a feature dictionary-based generative adversarial network (FD-GAN), which locally translates 2D landmarks into a personalized portrait, enabling one-shot portrait reenactment under large pose and expression variations. We validate the effectiveness of our identity disentangling capabilities via an extensive ablation study, and our method produces consistent identities for cross-subject portrait reenactment. Our comprehensive experiments show that our method significantly outperforms the state-of-the-art single-image facial reenactment methods. We will release our code and models for academic use.

研究の動機と目的

  • 1枚のターゲット画像しか利用できない状況において、異種被験者間のポートレート再現で生じるアイデンティティ不一致を解消すること。
  • 異なるドライビング被験者からの表情・ポーズを移し変えつつ、ターゲット被験者のアイデンティティを保持すること。
  • 被験者固有の微調整や学習を必要とせず、被験者に依存しない再現を可能にすること。
  • 顕著なポーズ・表情の変化に対しても、高精細で写真並みのリアルなポートレート合成を達成すること。
  • 2次元ランドマークベース手法がアイデンティティおよび顔面細部の保持に抱える限界を克服すること。

提案手法

  • ターゲット被験者のアイデンティティとドライビング被験者の表情・ポーズを統合したパーソナライズド顔ランドマークを予測することで、アイデンティティとポーズ・表情を分離するランドマーク分離ネットワーク(LD-Net)を提案する。
  • ランドマーク座標を局所的に変換してパーソナライズドポートレート画像を生成する特徴辞書ベースの生成的敵対ネットワーク(FD-GAN)を採用し、アイデンティティ保持型の合成を実現する。
  • 分離されたランドマーク表現を用いることで、ターゲットとドライバーの外見が著しく異なる場合でもアイデンティティの一貫性を確保する。
  • 被験者固有の適応なしに、事前学習済みの特徴辞書を用いてランドマーク特徴を高解像度の写真並みの顔画像にマッピングする。
  • 2次元ランドマークの監視と adversarial 学習を組み合わせることで、画像の忠実性および構造的一致性を向上させる。
  • 2段階フレームワークを設計:まずモーションの手がかりからアイデンティティを分離し、次に分離済みランドマークからアイデンティティ一貫性のある画像を生成する。

実験結果

リサーチクエスチョン

  • RQ12次元顔ランドマークは、異種被験者間再現のため、アイデンティティ不変のモーション成分とアイデンティティ固有の特徴に効果的に分離可能か?
  • RQ21枚の参照画像のみで、被験者固有の学習なしに高精細でアイデンティティ保持型のポートレート再現が可能か?
  • RQ3ランドマークベース手法は、顕著なポーズ・表情の変化を伴う未学習被験者へどれほど一般化可能か?
  • RQ4提案手法の特徴辞書ベースGANは、ワンショット設定において標準GANと比較してアイデンティティ保持性と画像品質を向上させるか?
  • RQ5ランドマーク分離は、ポートレート再現における時間的一致性および視覚的忠実性にどのような影響を及ぼすか?

主な発見

  • 提案手法は、CrossTestデータセットにおいて最高のアイデンティティ類似度スコア(ISIM)0.7762を達成し、X2Face(0.6347)およびFirst-order-model(0.7699)を上回った。
  • PSIMスコア0.840を達成し、ターゲットアイデンティティとの強い知覚的類似性を示し、ベースラインのFirst-order-model(0.822)を上回った。
  • エッジ歪み(ED)を0.243に低減し、X2Face(0.448)およびFirst-order-model(0.274)と比較して構造的一致性が向上した。
  • FIDスコア67.68は、より高いFIDにもかかわらず、アイデンティティ保持性に優れるため、実画像との分布的類似性が優れていることを示している(First-order-model:55.94)。
  • 定性的な結果から、外見が著しく異なるドライバーとターゲットに対しても、多様なポーズ・表情にわたり一貫したアイデンティティ保持が確認された。
  • アブレーションスタディにより、特に異種被験者シナリオにおいてランドマーク分離がアイデンティティ保持に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。