Skip to main content
QUICK REVIEW

[論文レビュー] Write-a-speaker: Text-based Emotional and Rhythmic Talking-head Generation

Lincheng Li, Suzhen Wang|arXiv (Cornell University)|Apr 16, 2021
Face recognition and analysis参考文献 63被引用数 8
ひとこと要約

本論文は、時刻同期されたテキスト入力を用いて、写真のようにリアルで感情表現豊かでリズミカルに同期された顔のアニメーションおよび頭部の動きを合成する、テキストベースの会話型ヘッド動画生成フレームワークを提案する。2段階のアーキテクチャ—テキストからの話者非依存な顔および頭部の動きのモデリング、その後に3D顔モデルを用いたアテンションネットワークを用いた話者特異的な適応—を活用することで、話者1人あたり5分のリファレンス動画のみで最先端の性能を達成する。

ABSTRACT

In this paper, we propose a novel text-based talking-head video generation framework that synthesizes high-fidelity facial expressions and head motions in accordance with contextual sentiments as well as speech rhythm and pauses. To be specific, our framework consists of a speaker-independent stage and a speaker-specific stage. In the speaker-independent stage, we design three parallel networks to generate animation parameters of the mouth, upper face, and head from texts, separately. In the speaker-specific stage, we present a 3D face model guided attention network to synthesize videos tailored for different individuals. It takes the animation parameters as input and exploits an attention mask to manipulate facial expression changes for the input individuals. Furthermore, to better establish authentic correspondences between visual motions (i.e., facial expression changes and head movements) and audios, we leverage a high-accuracy motion capture dataset instead of relying on long videos of specific individuals. After attaining the visual and audio correspondences, we can effectively train our network in an end-to-end fashion. Extensive experiments on qualitative and quantitative results demonstrate that our algorithm achieves high-quality photo-realistic talking-head videos including various facial expressions and head motions according to speech rhythms and outperforms the state-of-the-art.

研究の動機と目的

  • 音声依存の手法の制限を克服し、テキスト入力から高精細で感情表現豊かでリズミカルに正確な会話型ヘッド動画を生成すること。
  • 音声特徴ではなく時刻同期されたテキストを用いることで、話者一般化におけるトーンギャップ問題に対処すること。
  • 新規話者のための必要なリファレンス動画長を1時間以上からわずか5分に短縮すること。
  • 発話のリズムと感情に合わせて、口元、上顔、頭部の動きを統合的にモデリングすること。
  • 長時間の動画データではなく、高精度なモーショングラブキャプチャデータを用いて、本物の視覚的・音声的対応関係を確立すること。

提案手法

  • 時刻同期されたテキストから口元、上顔、頭部ポーズのアニメーションパラメータを生成するための、3つの並列ネットワークを備えた話者非依存ステージを用いる。
  • 話者特異的ステージでは、3D顔モデルをガイドとしたアテンションネットワークを用いて、一般化されたアニメーションパラメータをターゲット話者の個性に適応する。
  • 発話のリズム、感情、視覚的動きの間の正確な対応関係を確立するために、高精度なモーショングラブキャプチャデータを活用する。
  • エネルギー最小化関数を用いて、キーフレームのランドマークから3Dモーファブルモデル(3DMM)のフィッティング処理により、ポーズおよび表情パラメータを推定する。
  • 敵対的損失、再構成損失、顔のランドマークおよび表情の一貫性の正則化項を組み合わせた、エンドツーエンドのネットワーク訓練を実施する。
  • レンダリングネットワークにおいて、語彙、音素、感情の埋め込み(V^txt, V^ph, V^emo)を共有リプルブロックを介して用い、顔およびマスクの生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1音声依存のアプローチに依存せずに、感情表現豊かでリズミカルに正確な会話型ヘッド動画をテキストベースのフレームワークが生成可能か?
  • RQ2時刻同期されたテキスト入力のみから、顔および頭部の動きを効果的に統合的にモデリングできるか?
  • RQ35分間のリファレンス動画で、高精細な話者特異的動画生成が、1時間以上を要する従来手法に比べて十分に可能か?
  • RQ4長時間の動画記録ではなく、モーショングラブキャプチャデータを用いることで、視覚的アニメーションの質および同期性が向上するか?
  • RQ5提案された3D顔ガイドドアテンション機構は、生成動画におけるアイデンティティ保持および表情のリアルさをどのように向上させるか?

主な発見

  • 提案手法は、発話のリズムと感情に合わせて同期する豊富な表情とリズミカルな頭部の動きを有する写真のようにリアルな会話型ヘッド動画を生成する。
  • 本フレームワークは、定性的および定量的評価において最先端の手法を上回り、優れた視覚的精細さと時間的整合性を示す。
  • 話者特異的ステージは、5分間のリファレンス動画のみで高品質な結果を達成し、従来の手法に比べてデータ要件を顕著に低減する。
  • 時刻同期されたテキスト入力の使用により、トーンギャップ問題が効果的に軽減され、異なる話者および合成音声入力に対しても強固な性能が得られる。
  • モーショングラブキャプチャに基づくトレーニングデータにより、正確な視覚的・音声的対応関係の学習が可能となり、より自然で同期の取れたアニメーションが得られる。
  • 本手法は、時刻同期されたテキスト表現のみから、感情表現を伴い、リズミカルな頭部の動きを有する完全な会話型ヘッド動画を生成した初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。