Skip to main content
QUICK REVIEW

[論文レビュー] Audio-driven Talking Face Video Generation with Natural Head Pose

Ran Yi, Zipeng Ye|arXiv (Cornell University)|Feb 24, 2020
Face recognition and analysis被引用数 16
ひとこと要約

本稿では、音声と短いターゲット動画を活用して、パーソナライズされ自然な頭部ポーズを有する高品質な会話顔動画を生成する深層ニューラルネットワークを提案する。3次元顔アニメーションを再構築し、メモリ拡張GANを用いてフレームを精錬することで、わずか約300フレームの微調整データでさえも、リアルな頭部運動と口唇同期を実現する。

ABSTRACT

Real-world talking faces often accompany with natural head movement. However, most existing talking face video generation methods only consider facial animation with fixed head pose. In this paper, we address this problem by proposing a deep neural network model that takes an audio signal A of a source person and a very short video V of a target person as input, and outputs a synthesized high-quality talking face video with personalized head pose (making use of the visual information in V), expression and lip synchronization (by considering both A and V). The most challenging issue in our work is that natural poses often cause in-plane and out-of-plane head rotations, which makes synthesized talking face video far from realistic. To address this challenge, we reconstruct 3D face animation and re-render it into synthesized frames. To fine tune these frames into realistic ones with smooth background transition, we propose a novel memory-augmented GAN module. By first training a general mapping based on a publicly available dataset and fine-tuning the mapping using the input short video of target person, we develop an effective strategy that only requires a small number of frames (about 300 frames) to learn personalized talking behavior including head pose. Extensive experiments and two user studies show that our method can generate high-quality (i.e., personalized head movements, expressions and good lip synchronization) talking face videos, which are naturally looking with more distinguishing head movement effects than the state-of-the-art methods.

研究の動機と目的

  • 既存の会話顔動画手法が頭部ポーズを固定しているという制限に対処し、自然でパーソナライズされた頭部運動を可能にすること。
  • 自然な会話によって引き起こされる平面内および平面外の頭部回転をモデル化すること。これは、リアルな合成において困難な課題である。
  • 短いターゲット動画のみを用いて、同期された口唇運動と表現豊かな顔面動態を有する高精細な会話顔動画を生成すること。
  • わずか数フレーム(約300)のデータで、個人に特化した会話行動(頭部ポーズを含む)を効率的に学習する微調整戦略を開発すること。

提案手法

  • モデルは、ターゲット人物の音声Aと短い動画Vを入力とし、動的で頭部ポーズが変化するパーソナライズされた会話顔動画を生成する。
  • 音声と視覚的入力から3次元顔アニメーションを再構築することで、平面内および平面外の自然な頭部回転を実現する。
  • 合成フレームを精錬するため、メモリ拡張GANモジュールを導入し、滑らかな背景の遷移と写実的な品質を保証する。
  • 2段階の訓練戦略を採用:まず公開データセットで事前学習を行い、その後ターゲット人物の短い動画で微調整することで、個々の頭部運動パターンに適応する。
  • 短い動画Vからの視覚的手がかりを活用して、限られたフレーム数でもパーソナライズされた頭部ポーズ行動を推定する。
  • 音声と視覚的信号を共同でモデリングすることで、会話と口元の動きの時間的整合性を実現し、口唇同期を達成する。

実験結果

リサーチクエスチョン

  • RQ1短いターゲット人物の動画のみを用いて、自然でパーソナライズされた頭部運動を有する会話顔動画を生成できるか?
  • RQ23次元顔アニメーション再構築とGANベースの精錬が、動的頭部ポーズを有する合成会話顔動画のリアリズムをどの程度向上できるか?
  • RQ3わずか数フレーム(約300)の微調整データで、個人の頭部運動パターンをどの程度正確にモデル化できるか?
  • RQ4最先端の手法と比較して、本手法は口唇同期、顔面表情、頭部運動の自然さの面でどの程度優れているか?

主な発見

  • 提案手法は、最先端の手法と比較して、はるかに顕著で自然な頭部運動効果を有する会話顔動画を生成する。
  • ユーザースタディーの結果、正確な頭部ポーズダイナミクスのおかげで、生成動画がよりリアルで視覚的に魅力的であると認識されている。
  • 音声と視覚モalityの共同モデリングにより、効果的な整合性を確保することで、高品質な口唇同期を達成している。
  • ターゲット人物の動画からわずか約300フレームの微調整で、複雑な頭部ポーズパターンを含むパーソナライズされた会話行動を学習可能である。
  • メモリ拡張GANモジュールは、合成動画におけるフレームのリアリズムを向上させるとともに、滑らかな背景の遷移を確実に実現している。
  • 広範な実験により、多様なテストケースにおいて視覚的品質と動きの自然さの面で一貫した優位性が示されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。