Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal-driven Talking Face Generation via a Unified Diffusion-based Generator

Chao Xu, Shaoting Zhu|arXiv (Cornell University)|May 4, 2023
Face recognition and analysis被引用数 4
ひとこと要約

本稿では、感情制御にCLIP埋め込みを活用し、アイデンティティおよびジオメトリを保持するTexture-Geometry-aware Diffusion Model (TGDM) を用いて、ターゲット指向のテクスチャ転送として扱う、マルチモーダル駆動型トークイングフェイス生成の統合的で拡散ベースの生成器を提案する。本手法は、GANに依存しない安定的なトレーニングと推論を実現し、トークイングフェイス生成およびフェーススワッピングの両面で最先端の性能を達成する。

ABSTRACT

Multimodal-driven talking face generation refers to animating a portrait with the given pose, expression, and gaze transferred from the driving image and video, or estimated from the text and audio. However, existing methods ignore the potential of text modal, and their generators mainly follow the source-oriented feature rearrange paradigm coupled with unstable GAN frameworks. In this work, we first represent the emotion in the text prompt, which could inherit rich semantics from the CLIP, allowing flexible and generalized emotion control. We further reorganize these tasks as the target-oriented texture transfer and adopt the Diffusion Models. More specifically, given a textured face as the source and the rendered face projected from the desired 3DMM coefficients as the target, our proposed Texture-Geometry-aware Diffusion Model decomposes the complex transfer problem into multi-conditional denoising process, where a Texture Attention-based module accurately models the correspondences between appearance and geometry cues contained in source and target conditions, and incorporate extra implicit information for high-fidelity talking face generation. Additionally, TGDM can be gracefully tailored for face swapping. We derive a novel paradigm free of unstable seesaw-style optimization, resulting in simple, stable, and effective training and inference schemes. Extensive experiments demonstrate the superiority of our method.

研究の動機と目的

  • マルチモーダル駆動型トークイングフェイス生成におけるGANベース生成器の不安定さと一般化性能の低さを解消する。
  • ソース指向の特徴再配置の限界を克服するため、タスクをターゲット指向のテクスチャ転送として再定義する。
  • CLIP埋め込みを活用することで、柔軟でゼロショットの感情制御が可能なテキストモダリティを効果的に統合する。
  • 画像、動画、音声、テキスト駆動型トークイングフェイス生成を、単一の安定的で拡散ベースの生成器で統合する。
  • 見せかけの最適化を回避する再構成ベースの枠組みを用いて、フェーススワッピングへの拡張を実現する。

提案手法

  • テキストプロンプトをCLIP埋め込み感情埋め込みとして表現し、ゼロショットの感情制御に必要な豊富な意味的意味を継承する。
  • トークイングフェイス生成をターゲット指向のテクスチャ転送として定式化:3DMM係数からレンダリングされたターゲットフェースに、ソースフェースのテクスチャを転送する。
  • ソーステクスチャとターゲットジオメトリの両方に条件付けられたマルチ条件付きノイズ除去により、テクスチャとジオメトリに配慮した拡散モデル(TGDM)を設計する。
  • ソース外観とターゲットジオメトリ間のクロスアテンションをモデル化するためのテクスチャアテンションモジュールを統合する。
  • 3DMM係数を用いてターゲットフェースを3Dレンダリングし、構造的整合性を保証する条件のピボットとして利用する。
  • 同じTGDMフレームワークをフェーススワッピングに適応するため、ソースアイデンティティ領域をマスクし、レンダリングされたターゲットフェースを条件として用いることで、安定的な再構成ベースのトレーニングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1微調整を必要とせずに、テキストモダリティを効果的に活用してトークイングフェイス生成における感情制御を実現できるか?
  • RQ2統合的拡散ベース生成器が、マルチモーダル駆動型トークイングフェイス生成におけるタスク特化型GANベースアーキテクチャを置き換えることができるか?
  • RQ3アイデンティティの保持とアーティファクトの低減において、ソース指向の特徴再配置と比較して、ターゲット指向のテクスチャ転送パラダイムが優れているか?
  • RQ4提案されたTGDMフレームワークは、安定的でGANに依存しないトレーニングと推論を実現するフェーススワッピングに拡張可能か?
  • RQ5CLIP埋め込みテキストの使用は、顔面アニメーションにおけるゼロショット感情一般化をどのように向上させるか?

主な発見

  • 提案手法は、FaceForensics++データセットにおいて15.87 FIDスコアを達成し、先行手法を上回る最先端の性能を示した。
  • アイデンティティ保持と属性の一貫性において、0.6121 ID-A(アイデンティティ正確度)と0.1122の角度誤差を達成し、競合手法を大きく上回った。
  • アブレーションスタディの結果、口の領域のみを除いた小さなマスクを使用した場合が、フルマスクや拡張マスクよりも優れたリアルさを実現し、アーティファクトを低減した。
  • レンダリングされた3Dフェースを条件として排除した場合、色のバイアスがソースフェースに近づくことが示され、その条件が属性保持において極めて重要な役割を果たしていることが明らかになった。
  • TGDMフレームワークにより、単純な再構成損失を用いた安定したトレーニングが可能となり、GANベースのフェーススワッピングで一般的な不安定な交互最適化(見せかけの最適化)を回避した。
  • CLIPガイドドのテキストプロンプトにより、再トレーニングを必要とせずに未観測の感情に対しても良好な一般化性能を示し、ゼロショットの感情制御を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。