[論文レビュー] Talking Head Generation with Audio and Speech Related Facial Action Units
本稿では、音声と発話関連の顔面運動単位(AUs)をドライビング信号として統合することで、唇の同期精度とリアリズムを向上させる、新しい再帰的生成ネットワークを提案する。音声からAUへの変換モジュールとAU分類器を導入することで、GRIDおよびTCD-TIMITデータセットにおいて、画像品質と時間的整合性の両面で最先端の性能を達成した。
The task of talking head generation is to synthesize a lip synchronized talking head video by inputting an arbitrary face image and audio clips. Most existing methods ignore the local driving information of the mouth muscles. In this paper, we propose a novel recurrent generative network that uses both audio and speech-related facial action units (AUs) as the driving information. AU information related to the mouth can guide the movement of the mouth more accurately. Since speech is highly correlated with speech-related AUs, we propose an Audio-to-AU module in our system to predict the speech-related AU information from speech. In addition, we use AU classifier to ensure that the generated images contain correct AU information. Frame discriminator is also constructed for adversarial training to improve the realism of the generated face. We verify the effectiveness of our model on the GRID dataset and TCD-TIMIT dataset. We also conduct an ablation study to verify the contribution of each component in our model. Quantitative and qualitative experiments demonstrate that our method outperforms existing methods in both image quality and lip-sync accuracy.
研究の動機と目的
- 既存の会話ヘッド生成手法が局所的な口の筋肉のダイナミクスを無視するという制限を解消し、不良な唇の同期とジターリングを回避すること。
- 発話関連の顔面運動単位(AUs)を細分化された局所的ドライビング信号として組み込むことで、顔面アニメーションの正確性を向上させること。
- アイデンティティを保持し、高精細な会話ヘッド動画を合成するため、音声とAU表現を統合的に活用するエンドツーエンドフレームワークを開発すること。
- フレーム識別器とAUの監視を用いた敵対的訓練により、リアリズムと時間的整合性を向上させること。
提案手法
- 音声埋め込みと予測された発話関連顔面運動単位(AUs)をドライビング条件として用い、口の動きを制御する再帰的生成ネットワークを導入する。
- 音声入力から直接発話関連AU活性化(例:AU10, AU14, AU20, AU25, AU26)を予測する音声からAUへの変換モジュールを設計し、シーケンス・ツー・シーケンスアーキテクチャを用いる。
- 生成されたフレームの監視に事前学習済みのAU分類器を活用し、出力動画における正しいAU活性化パターンが保持されることを保証する。
- フレームレベルの識別器を用いた敵対的訓練を適用し、生成された顔面画像のリアリズムと視覚的品質を向上させる。
- 再構成損失、知覚的損失、アイデンティティ損失、敵対的損失、およびAU固有の損失を含むマルチコンポonent損失を用い、統合最適化を実現する。
- 繰り返し構造(例:LSTMまたは類似構造)を活用して、連続フレーム間の時間的依存関係をモデル化し、ジターリングを低減し、動きのなめらかさを向上させる。
実験結果
リサーチクエスチョン
- RQ1発話関連の顔面運動単位(AUs)を局所的ドライビング信号として統合することで、音声駆動型会話ヘッド生成における唇の同期精度が向上するか?
- RQ2エンドツーエンドの音声からAUへの変換モジュールは、生の音声からAU活性化を予測する際にどの程度有効か?
- RQ3AUの監視は、音声のみのベースラインと比較して、生成された顔面運動のリアリズムと正確性をどの程度向上させるか?
- RQ4敵対的訓練とAUに配慮した損失を組み合わせることで、生成された会話ヘッド動画の画像品質と時間的整合性が両方向上するか?
主な発見
- 音声からAUへの変換モジュールを備えた完全なモデルは、GRIDデータセットで最高のPSNR(29.838)とSSIM(0.769)を達成し、すべてのアブレーション変種を上回った。
- GRIDテストセットでは平均AU F1スコアが0.949、正答率が90.79%を記録し、優れたAU生成忠実度を示した。
- ユーザースタディーでは、77%の参加者が本手法をCRAN [Song et al., 2019] よりも唇の同期精度で好んだ一方、92%が動画のなめらかさで本手法を好んだ。
- アブレーションスタディーにより、特に音声からAUへの変換モジュールとAU損失が、唇の同期精度と視覚的品質の両方を顕著に向上させたことが確認された。
- 音声からAUへの変換モジュールの追加により、平均AU F1スコアがベースラインから0.22上昇し、発話と運動の対応関係を捉える有効性が裏付けられた。
- 画像品質、唇の同期精度、動きのなめらかさの観点で、GRIDおよびTCD-TIMITデータセットの両方で最先端の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。