Skip to main content
QUICK REVIEW

[論文レビュー] Speech2Video Synthesis with 3D Skeleton Regularization and Expressive Body Poses

Miao Liao, Sibo Zhang|arXiv (Cornell University)|Jul 17, 2020
Human Pose and Action Recognition参考文献 33被引用数 5
ひとこと要約

本稿では、3次元スケルトン正則化とパーソナライズドジェスチャー辞書を活用して、音声から写真のようにリアルで表現力のある全身ビデオを生成する2段階の音声から動画への合成フレームワークを提案する。音声から3次元ボディポーズを予測するRNNを用い、表現力を高めるためにキーポーズを挿入し、アテンション機構を備えたパーツに配慮したGANを採用して、高解像度で歪みのない、顔や手の詳細が再現されたビデオを生成する。

ABSTRACT

In this paper, we propose a novel approach to convert given speech audio to a photo-realistic speaking video of a specific person, where the output video has synchronized, realistic, and expressive rich body dynamics. We achieve this by first generating 3D skeleton movements from the audio sequence using a recurrent neural network (RNN), and then synthesizing the output video via a conditional generative adversarial network (GAN). To make the skeleton movement realistic and expressive, we embed the knowledge of an articulated 3D human skeleton and a learned dictionary of personal speech iconic gestures into the generation process in both learning and testing pipelines. The former prevents the generation of unreasonable body distortion, while the later helps our model quickly learn meaningful body movement through a few recorded videos. To produce photo-realistic and high-resolution video with motion details, we propose to insert part attention mechanisms in the conditional GAN, where each detailed part, e.g. head and hand, is automatically zoomed in to have their own discriminators. To validate our approach, we collect a dataset with 20 high-quality videos from 1 male and 1 female model reading various documents under different topics. Compared with previous SoTA pipelines handling similar tasks, our approach achieves better results by a user study.

研究の動機と目的

  • 既存の音声から動画への合成手法において、表現力があり物理的に妥当な全身運動が不足している問題に対処すること。
  • 限られた動画記録からのパーソナライズドジェスチャーの学習におけるデータのスパarsityと多様性の問題を克服すること。
  • 特に手や顔領域において、視覚的精細度を向上させ、幾何学的歪みを低減すること。
  • 運動シーケンスにキーポーズを挿入することで、表現力のあるジェスチャーを制御可能にすること。

提案手法

  • 2段階のパイプラインを採用:まず、RNNが音声音声から3次元スケルトンシーケンスを生成し、人間の運動制約を満たすことで物理的妥当性を確保する。
  • 実際のスピーチ動画から得たキーポーズのパーソナライズド辞書を構築し、合成時に文脈的に適切なジェスチャーを挿入可能にする。
  • パーツに配慮した識別器を備えた条件付きGANを設計し、顔、手、頭部などの重要な領域の詳細を向上させるために空間アテンションを適用し、各身体部位ごとに別々に識別を行う。
  • 3次元スケルトンジョイントを中間監視として用いることで、解剖学的に不適切なポーズを防ぎ、動きのリアリズムを向上させる。
  • 訓練データの分布に合わせるため、TTS生成音声に背景ノイズを追加し、口元の歪みを回避する。
  • 学習された補間機構を用いて、キーポーズをスケルトンシーケンスに挿入し、表現力を高める。

実験結果

リサーチクエスチョン

  • RQ13次元スケルトン正則化は、音声駆動の全身運動の物理的妥当性とリアリズムを向上させることができるか?
  • RQ2限られた学習データから学習されたパーソナライズドジェスチャー辞書は、運動の表現力を高めるのにどの程度有効か?
  • RQ3パーツに配慮したGANは、高解像度動画生成における視覚的精細度を著しく向上させ、ぼやけを低減できるか?
  • RQ4運動シーケンスにキーポーズを挿入することで、より表現的で直感的に自然な動画出力が得られるか?

主な発見

  • 提案手法は、全体的な視覚的品質について5段階評価で3.42点を達成し、実動画ベースラインの4.38点に近く、強い知覚的リアリズムを示した。
  • TTS音声からの生成動画は、すべての指標で実スピーチ音声からの生成動画を下回り、不自然な音声と背景ノイズの欠如により、評価品質が著しく低下した。
  • アブレーションスタディの結果、80.6%の参加者がキーポーズを挿入した動画を挿入なしのものよりも好んだことから、キーポーズの表現力向上効果が確認された。
  • スケルトンから手のモデルを除去した場合、継続的なぼやけと手の詳細の再現不能が生じ、明示的な手のモデリングの必要性が証明された。
  • TTS音声にホワイトノイズを追加することで、口元の形状のリアリズムが向上し、訓練データの統計と一致させる重要性が示された。
  • パーツに配慮したGANは、標準GANと比較して顔や手の領域の詳細を著しく向上させ、ぼやけや幾何学的歪みを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。