[論文レビュー] TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
TalkCLIPは、参照動画を必要とせず、自然言語の記述によって表現的な顔のアニメーションを制御する、テキスト誘導型でワンショットの会話ヘッド生成手法を提案する。CLIPベースのスタイルエンコーダーを活用してテキストを会話スタイルの埋め込みにマッピングすることで、未学習のテキスト記述に対しても一般化性が高く、音声およびテキストとの整合性において、既存手法を上回る表現的な顔のアニメーションを実現する。
Audio-driven talking head generation has drawn growing attention. To produce talking head videos with desired facial expressions, previous methods rely on extra reference videos to provide expression information, which may be difficult to find and hence limits their usage. In this work, we propose TalkCLIP, a framework that can generate talking heads where the expressions are specified by natural language, hence allowing for specifying expressions more conveniently. To model the mapping from text to expressions, we first construct a text-video paired talking head dataset where each video has diverse text descriptions that depict both coarse-grained emotions and fine-grained facial movements. Leveraging the proposed dataset, we introduce a CLIP-based style encoder that projects natural language-based descriptions to the representations of expressions. TalkCLIP can even infer expressions for descriptions unseen during training. TalkCLIP can also use text to modulate expression intensity and edit expressions. Extensive experiments demonstrate that TalkCLIP achieves the advanced capability of generating photo-realistic talking heads with vivid facial expressions guided by text descriptions.
研究の動機と目的
- 音声駆動型会話ヘッド生成において、望ましい会話スタイルを持つ参照動画を入手することが難しいという課題に対処すること。
- 参照動画ではなく自然言語の記述によって制御される表現的な会話ヘッド生成を可能にすること。
- 学習用に、粗い感情ラベルと詳細な顔の運動ユニット(AU)ラベルを備えたテキスト-動画ペairedデータセットを構築すること。
- ドメイン外のテキスト記述に対しても一般化可能な、CLIPベースのテキストから会話スタイルへのエンコーダーを構築すること。
- 音声駆動型の顔面アニメーションデコーダーと画像レンダラを統合し、高精細で写真のようにリアルな会話ヘッド動画を生成し、テキストによってガイドされた一貫性のある顔の表情を実現すること。
提案手法
- MEADデータセットに、粗い感情ラベルとAUに基づく詳細な顔の運動記述という2段階のプロンプトベースのテキスト記述を付加する。
- 自然言語記述を潜在的会話スタイルコードにマッピングするCLIPベースのテキストから会話スタイルへのエンコーダー(T2SS)を設計する。
- 静的テキスト埋め込みと動的顔面運動の間のギャップを埋めるために、軽量なアダプターネットワークを導入する。
- 参照動画からスタイル表現を抽出するビデオから会話スタイルへのエンコーダー(V2SS)を導入し、T2SSとV2SSの出力間で対照的学習を実施する。
- 同じ動画に対してT2SSエンコーダーの潜在的スタイルコードとV2SSエンコーダーのそれとの距離を最小化することで、T2SSエンコーダーを訓練する。
- 学習済みのスタイルコードを音声駆動型顔面アニメーションデコーダーと画像レンダラに統合し、写真のようにリアルな会話ヘッド動画を生成する。
実験結果
リサーチクエスチョン
- RQ1参照動画が一致しなくても、自然言語の記述がワンショット会話ヘッド生成における表現的な会話スタイルを効果的に制御できるか?
- RQ2トレーニング時に見られなかったドメイン外(OOD)のテキスト記述に対し、CLIPベースのテキストエンコーダーはどの程度一般化して会話スタイルを推定できるか?
- RQ3動画ベースの参照スタイル制御と比較して、テキストベースのスタイル制御が、口唇同期と顔の表情の一貫性において、どの程度の性能を発揮できるか?
- RQ4感情+AUを組み合わせたプロンプトベースのテキストアノテーションは、顔面運動パターンとの意味的対応関係をどの程度的確に捉えられるか?
- RQ5抽象的な言語表現、慣用句、音声と感情の不一致に対処する際、テキスト誘導型スタイル制御にはどのような限界があるか?
主な発見
- TalkCLIPは、比較対象のすべての手法の中で最高の口唇同期スコアを達成しており、音声と視覚の整合性が優れていることを示している。
- 同レンダラを用いた最先端手法と同等の、競争力のある動画のリアルさスコアを達成している。
- 動画ベースのベースライン(EAMM、GC-AVT)を上回り、最も優れた手法(StyleTalk)と同等の、参照動画とのスタイルの一貫性を達成している。
- すべてのベースラインを大きく上回り、テキスト記述とのスタイルの一貫性が顕著に向上しており、効果的なテキストからスタイルへの対応付けが実証された。
- ユーザースタディーでは、感情の記述に関して77%、顔の動きの記述に関して73%のテキスト記述が正確であると評価され、TA-MEADデータセットの品質が裏付けられた。
- 抽象的表現や慣用句に対しても一般化が可能であるが、比喩的・比喩的表現が強い言語では性能が低下する傾向がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。