[論文レビュー] Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion
この論文では、1枚の参照画像と音声から、写真のようにリアルでリズミカルな頭部運動を生成する、新しい音声駆動型トークイングヘッド生成フレームワークであるAudio2Headを提案する。運動を認識するRNNとキーポイントベースの密運動場の表現を用いて、頭部運動予測と顔の表情生成を分離することで、最小限の背景アーティファクトで同期的で自然な頭部運動を実現し、視覚的品質と運動のリアルさにおいてSOTAを上回る。
We propose an audio-driven talking-head method to generate photo-realistic talking-head videos from a single reference image. In this work, we tackle two key challenges: (i) producing natural head motions that match speech prosody, and (ii) maintaining the appearance of a speaker in a large head motion while stabilizing the non-face regions. We first design a head pose predictor by modeling rigid 6D head movements with a motion-aware recurrent neural network (RNN). In this way, the predicted head poses act as the low-frequency holistic movements of a talking head, thus allowing our latter network to focus on detailed facial movement generation. To depict the entire image motions arising from audio, we exploit a keypoint based dense motion field representation. Then, we develop a motion field generator to produce the dense motion fields from input audio, head poses, and a reference image. As this keypoint based representation models the motions of facial regions, head, and backgrounds integrally, our method can better constrain the spatial and temporal consistency of the generated videos. Finally, an image generation network is employed to render photo-realistic talking-head videos from the estimated keypoint based motion fields and the input reference image. Extensive experiments demonstrate that our method produces videos with plausible head motions, synchronized facial expressions, and stable backgrounds and outperforms the state-of-the-art.
研究の動機と目的
- 1枚の参照画像から、自然で音声に同期した頭部運動を伴う写真のようにリアルなトークイングヘッド動画を生成すること。
- 学習データにおける曇った頭部運動-音声の対応関係の課題に対処すること。
- 大きな頭部ポーズ変化時における非顔領域(例:髪、背景)の視覚的アーティファクトを抑えること。
- 生成された動画シーケンスにおける時間的および空間的整合性を向上させること。
- SOTA手法と比較して優れた視覚的品質と運動のリアルさを達成すること。
提案手法
- 音声から6次元剛体頭部ポーズを予測する運動を認識する再帰的ニューラルネットワーク(RNN)を用い、低周波数の包括的頭部運動をモデル化する。
- 顔領域、頭部、背景のすべてを同時にモデル化するキーポイントベースの密運動場表現を用いる。
- 画像運動場生成器は、音声、予測された頭部ポーズ、および参照画像を入力とし、相対的キーポイントの変位から密運動場を生成する。
- 生成された運動場を微分可能ワープを用いて参照画像に適用し、高精細な動画合成を実現する。
- ニューラル画像生成ネットワークが、変形された特徴量と運動場から写真のようにリアルなフレームをレンダリングする。
- ピクセルレベルの整合性損失と構造的類似性(SSIM)損失を用いた2段階の訓練戦略により、時間的整合性と視覚的精細度が向上する。
実験結果
リサーチクエスチョン
- RQ11枚の画像と音声駆動型トークイングヘッド生成モデルは、話し言葉のプロソディーに合った自然でリズミカルな頭部運動を生成できるか?
- RQ2頭部運動予測を顔の表情生成から分離することで、曇りを減らし、リアルさを向上させられるか?
- RQ3大きな頭部ポーズ変化時において、キーポイントベースの密運動場表現は顔領域および非顔領域の両方の運動を効果的にモデル化し、安定化できるか?
- RQ4運動場正則化と損失関数は、時間的整合性と視覚的品質にどのような影響を与えるか?
- RQ5SOTA手法と比較して、本手法は、唇の同期精度、頭部運動の品質、背景アーティファクトの抑制においてどのように優れているか?
主な発見
- 本手法は、ユーザー評価において自然さスコアが66.7%(5段階スケールの4以上5)を達成し、すべてのSOTA手法を顕著に上回った。
- VoxCelebにおける定量的評価では、PSNRが21.19、SSIMが0.68を達成し、優れた視覚的精細度を示した。
- アブレーションスタディの結果、ヤコビアン正則化を削除すると不自然な唇の動きが生じる一方、SETモジュールを省略するか、2段階目の訓練段階を省くとジターリングが増加し、同期性が低下した。
- 大きな頭部ポーズ変化時でも背景が安定しており、最小限のテクスチャ歪みやアーティファクトが生じた。
- 本手法は優れた運動のリアルさを達成しており、ユーザーは本手法の頭部運動がベースライン手法よりもより自然でリズミカルに感じた。
- 両唇音(例:p, f, m)におけるわずかな唇の同期精度の低下はあったが、全体としての視覚的品質と運動のリアルさがユーザーに好まれた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。