Skip to main content
QUICK REVIEW

[論文レビュー] Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion

Sen Chen, Zhilei Liu|arXiv (Cornell University)|Apr 27, 2022
Speech and Audio Processing被引用数 7
ひとこと要約

本論文は、音声と発話関連の顔面運動単位(AUs)をドライビング信号として用い、マルチモーダル特徴統合に拡張された非因果的時系列畳み込み自己注意ネットワーク(TCSAN)を採用する、新しい会話ヘッド生成フレームワークを提案する。音声からAUsを予測する機構とAUsに配慮した損失関数を統合することで、リップシンクの正確性と画像品質が向上し、GRIDおよびTCD-TIMITデータセットにおいて最先端の手法を上回る性能を発揮する。

ABSTRACT

Talking head generation is to synthesize a lip-synchronized talking head video by inputting an arbitrary face image and corresponding audio clips. Existing methods ignore not only the interaction and relationship of cross-modal information, but also the local driving information of the mouth muscles. In this study, we propose a novel generative framework that contains a dilated non-causal temporal convolutional self-attention network as a multimodal fusion module to promote the relationship learning of cross-modal features. In addition, our proposed method uses both audio- and speech-related facial action units (AUs) as driving information. Speech-related AU information can guide mouth movements more accurately. Because speech is highly correlated with speech-related AUs, we propose an audio-to-AU module to predict speech-related AU information. We utilize pre-trained AU classifier to ensure that the generated images contain correct AU information. We verify the effectiveness of the proposed model on the GRID and TCD-TIMIT datasets. An ablation study is also conducted to verify the contribution of each component. The results of quantitative and qualitative experiments demonstrate that our method outperforms existing methods in terms of both image quality and lip-sync accuracy.

研究の動機と目的

  • 既存の会話ヘッド生成手法がクロスモーダル相互作用と局所的な口部筋肉のダイナミクスを無視するという限界を是正すること。
  • 発話関連の顔面運動単位(AUs)を補助的ドライビング信号として統合することで、リップシンクの正確性と視覚的品質を向上させること。
  • 長距離の時系列依存関係とクロスモーダル関係を捉える、堅牢なマルチモーダル統合メカニズムを開発すること。
  • 事前学習済みのAUs分類器とAUs損失を用いて、生成された顔面に正しいAUsパターンが含まれることを保証すること。
  • クロスデータベース生成を用いて、モデルの汎化能力をデータセット間で検証すること。

提案手法

  • 長距離の時系列依存関係をモデル化し、クロスモーダル特徴相互作用を強化するために、拡張された非因果的時系列畳み込み自己注意ネットワーク(TCSAN)を導入する。
  • 音声入力から発話関連の顔面運動単位(AUs)を予測する音声からAUsへのモジュールを設計し、局所的な口部運動のガイドラインを提供する。
  • 事前学習済みのAUs分類器を用いて、AUs損失部を介して生成フレームに現実的なAUsパターンを強制する。
  • 再構成損失、知覚的損失、アイデンティティ損失、AUs損失を組み合わせることで、画像の忠実性と同期性を向上させる。
  • 因果的でないTCNアーキテクチャを採用し、過去と未来の文脈を活用することで、因果的RNNやTCNよりも優れた時系列モデリングを実現する。
  • TCSANモジュールを通じて音声とAUs特徴を統合し、モード間の関係を捉える共同表現学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1発話関連の顔面運動単位(AUs)をドライビング信号として統合することで、会話ヘッド生成におけるリップシンクの正確性が向上するか?
  • RQ2拡張された非因果的時系列畳み込み自己注意ネットワーク(TCSAN)は、音声と顔面運動の間のクロスモーダル関係をどの程度効果的にモデル化できるか?
  • RQ3音声からAUsへのモジュールは、音声のみをドライビング信号とする場合と比較して、口部運動の現実性と正確性を向上させるか?
  • RQ4提案されたマルチモーダル統合メカニズムは、ベースラインと比較して、画像品質と時系列の一貫性をどの程度向上させるか?
  • RQ5モデルは、例えばGRIDで学習したモデルを用いてTCD-TIMITデータセット上で高品質な会話ヘッドを生成できるほど汎化可能か?

主な発見

  • 提案モデルは、画像品質およびリップシンクの正確性の両面で、GRIDおよびTCD-TIMITデータセットにおいて最先端の性能を達成した。
  • アブレーションスタディにより、特にTCSANモジュールとAUs損失が生成品質と同期性の向上に顕著な寄与をしていることが確認された。
  • 音声からAUsへのモジュールは、音声から発話関連のAUsを効果的に予測し、より正確で自然な口部運動を実現した。
  • 静音の音声入力に対しても、モデルは高い視覚的忠実性を維持し、不自然なリップ運動の発生を抑制するという、強靭性を示した。
  • GRIDで学習したモデルを用いたTCD-TIMITへのクロスデータベース生成では、強力な汎化能力が示され、入力音声に一致する一貫性があり正確な口部運動が得られた。
  • 定性的な結果では、完全なモデルがベースラインを上回り、顔の質感、歯の明瞭度、リップシンクロニゼーションの面で優れた性能を示した。図11の赤枠で囲まれた例は、同期エラーの低減を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。