Skip to main content
QUICK REVIEW

[論文レビュー] Live Speech Portraits: Real-Time Photorealistic Talking-Head Animation

Yuanxun Lu, Jinxiang Chai|arXiv (Cornell University)|Sep 22, 2021
Face recognition and analysis参考文献 72被引用数 11
ひとこと要約

ライブ音声ポートレート(LSP)は、30 fpsを超えるリアルタイムで、音声駆動型のパーソナライズド・フォトリアルな会話ヘッドアニメーションを生成する最初のシステムである。音声特徴抽出と多様体射影を用いて、野生の音声をターゲット・スピーカーの発話空間に適応させ、自己回帰的確率モデルを用いてパーソナライズドなヘッドポーズを生成し、条件付き特徴マップを介した画像対画像変換ネットワークにより、リアルタイムで高精細な顔面の詳細と動きを合成する。

ABSTRACT

To the best of our knowledge, we first present a live system that generates personalized photorealistic talking-head animation only driven by audio signals at over 30 fps. Our system contains three stages. The first stage is a deep neural network that extracts deep audio features along with a manifold projection to project the features to the target person's speech space. In the second stage, we learn facial dynamics and motions from the projected audio features. The predicted motions include head poses and upper body motions, where the former is generated by an autoregressive probabilistic model which models the head pose distribution of the target person. Upper body motions are deduced from head poses. In the final stage, we generate conditional feature maps from previous predictions and send them with a candidate image set to an image-to-image translation network to synthesize photorealistic renderings. Our method generalizes well to wild audio and successfully synthesizes high-fidelity personalized facial details, e.g., wrinkles, teeth. Our method also allows explicit control of head poses. Extensive qualitative and quantitative evaluations, along with user studies, demonstrate the superiority of our method over state-of-the-art techniques.

研究の動機と目的

  • 音声のみで駆動されるリアルタイムでパーソナライズ可能かつフォトリアルな会話ヘッドアニメーションシステムの開発。
  • 野生的で制御の難しい音声を、表現的でスピーカー固有の顔面の動きやダイナミクスにマッピングする課題への対処。
  • 音声のみから制御可能で時間的に整合性のあるヘッドおよび上半身の動き生成。
  • しわや歯といった個々の特徴を保持する高精細でリアルな顔面レンダリングの合成。
  • 視覚的品質やパーソナライズーションを損なわず、リアルタイム性能(30+ fps)を達成すること。

提案手法

  • 自己教師付き音声特徴抽出器が、生の音声からスピーカーに依存しない表現を生成する。
  • 多様体射影レイヤーが、ターゲット固有のリファレンス特徴を用いて、野生の音声特徴をターゲット・スピーカーの発話空間にマッピングする。
  • 自己回帰的確率モデルが、現在の音声と歴史的ポーズの両方に条件づけられたヘッドポーズ分布を予測し、パーソナライズされ、整合性のある動きを実現する。
  • 予測されたヘッドポーズから上半身の動きを推定し、時間的一致性を維持する。
  • 顔のキーポイントおよびポーズの予測から、条件付き特徴マップを生成し、それらを画像対画像変換ネットワークに供給する。
  • 画像変換ネットワークが、候補画像セットと予測された動き特徴を用いてフォトリアルなフレームを合成し、高精細レンダリングを実現する。

実験結果

リサーチクエスチョン

  • RQ1任意の野生的で制御の難しい音声入力から、リアルタイムでパーソナライズ可能かつフォトリアルな会話ヘッドアニメーションを生成できるか?
  • RQ2音声特徴をどのように適応させれば、顔のテクスチャーや動きのスタイルといった個々の発話の特徴を保持できるか?
  • RQ3ヘッドポーズの自己回帰的モデリングが、音声駆動アニメーションにおける時間的一致性とパーソナライズーションを向上させられるか?
  • RQ4ニューラルレンダリングは、リアルタイム制約下でもしわや歯といったリアルな顔面の詳細をどの程度再現できるか?
  • RQ5定性的および定量的評価において、最先端の手法と比較して、このシステムはどの程度の性能を示すか?

主な発見

  • システムは30 fpsを超えるリアルタイム性能を達成し、ビデオ会議やバーチャルアバターのようなインタラクティブなアプリケーションを可能にする。
  • 多様体射影モジュールが、野生の音声をターゲット・スピーカーの発話空間に成功裏に適応させ、しわや歯といった個々の顔面特徴を保持した。
  • 自己回帰的ヘッドポーズモデルが動きの一貫性とパーソナライズーションを向上させ、ニューラルレンダリングにおける性能劣化を低減した。
  • ユーザースタディーの結果、LSPは最先端の手法よりもリアリズム、リップシンクの正確性、表現力の面で好まれることが確認された。
  • 定量的評価では、FID、LPIPS、および音声視覚同期メトリクスにおいて、先行手法を上回る性能を示した。
  • システムは未観測の音声にも良好に一般化でき、/p/、/b/、/m/といった挑戦的な子音に対しても対応可能であるが、30 fpsでは短い音声バーストが見逃される可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。