Skip to main content
QUICK REVIEW

[論文レビュー] ZeroEGGS: Zero-shot Example-based Gesture Generation from Speech

Saeed Ghorbani, Ylva Ferstl|arXiv (Cornell University)|Sep 15, 2022
Human Pose and Action Recognition被引用数 10
ひとこと要約

ZeroEGGS は、短い例示モーショングリップのみを用いて、そのスタイルの事前学習を必要とせずにゼロショットスタイル制御を可能にする音声駆動型全身ジェスチャー生成のニューラルフレームワークである。変分自己オートエンコーダを用いて潜在空間における分離済みのスタイル埋め込みを学習し、柔軟なスタイル操作、ブレンド、多様で自然なジェスチャーの確率的生成を可能にする。

ABSTRACT

We present ZeroEGGS, a neural network framework for speech-driven gesture generation with zero-shot style control by example. This means style can be controlled via only a short example motion clip, even for motion styles unseen during training. Our model uses a Variational framework to learn a style embedding, making it easy to modify style through latent space manipulation or blending and scaling of style embeddings. The probabilistic nature of our framework further enables the generation of a variety of outputs given the same input, addressing the stochastic nature of gesture motion. In a series of experiments, we first demonstrate the flexibility and generalizability of our model to new speakers and styles. In a user study, we then show that our model outperforms previous state-of-the-art techniques in naturalness of motion, appropriateness for speech, and style portrayal. Finally, we release a high-quality dataset of full-body gesture motion including fingers, with speech, spanning across 19 different styles.

研究の動機と目的

  • 未学習の話者やモーショングリップスタイルに一般化できる、表現的でスタイリッシュな全身ジェスチャーを音声から生成する課題に対処すること。
  • 手作業で作成されたラベルや大量のトレーニングデータではなく、短い例示クリップによるスタイル制御を可能にすること。
  • 柔軟な操作や補間が可能な、意味のある潜在空間内の分離済みスタイル表現を学習すること。
  • 確率的生成フレームワークを用いて、多様で自然で音声に適したジェスチャーを生成すること。
  • 研究の再現性を確保するため、同期された音声と全身モーショングリップを備えた高品質でマルチスタイルの全身ジェスチャー・データセットを公開すること。

提案手法

  • 短い例示モーショングリップから分離済みのスタイル埋め込みを学習するため、条件付き変分自己オートエンコーダ(VAE)を用いる。
  • 音声入力を、話者や言語の変動に強く対応できるように、生のスペクトル音声特徴量で条件づける。
  • 潜在空間において、スタイル埋め込みをブレンド・スケーリング・補間することで、新しいスタイルの組み合わせを可能にする。
  • 同じ音声入力に対して潜在空間の再サンプリングを活用し、人間の運動における確率的性質を捉える多様なジェスチャー出力を生成する。
  • 滑らかで安定し、自然に見えるアニメーションを保証するため、モーション固有の損失関数を適用する。
  • 指の動きを含む、同期された音声と全身モーショングリップを備えた、19種類の異なるジェスチャー・スタイルを含む大規模データセット上で、エンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ11つの例示クリップでのスタイル条件付けのみで、再トレーニングなしに未学習のモーショングリップスタイルに一般化できるジェスチャー生成モデルは、性能を発揮するか?
  • RQ2手作業で作成された統計やラベルと比較して、例示ベースのスタイル制御は、繊細で表現的なモーショングリップスタイルをどれほど効果的に捉えられるか?
  • RQ3潜在空間に学習されたスタイル埋め込みは、スタイル間のブレンドや補間といった意味のある操作をどの程度可能にするか?
  • RQ4決定的ベースラインと比較して、確率的生成フレームワークはジェスチャー出力の多様性と自然さを向上させるか?
  • RQ5主観的評価において、未学習の話者、言語、モーショングリップスタイルにおいて、モデルはどの程度の性能を示すか?

主な発見

  • ZeroEGGS は、自身のデータセットにおいて、最先端のベースライン(MG)をすべての主観的評価指標で上回った:自然さ(56.3 ± 22.2)、音声に適したジェスチャー性(48.9 ± 20.3)、スタイル表現(58.1 ± 25.9)。
  • TSG データセットでは、61.9 ± 23.3 のスタイル表現スコアを達成し、ベースライン(19.8 ± 18.0)を顕著に上回り、強力なゼロショット一般化性能を示した。
  • トレーニング時に見られなかった新しい話者や言語に対しても、高い知覚的品質とスタイル忠実度を維持して一般化した。
  • VAE がもたらす潜在空間の操作により、スタイル埋め込みの滑らかな補間とブレンドが可能になり、アニメーション内での動的なスタイル遷移が実現された。
  • 強力な性能を発揮したが、音声に適したジェスチャー性において、実測値(TSG で 36.7 ± 18.4)は実測値(32.7 ± 21.0)を下回っており、意味的ジェスチャー整合性の向上の余地があることが示された。
  • モデルはしばしば局所的で低周波数のジェスチャー(例:同意スタイルにおける頭の上下運動)を過剰に平滑化し、その特徴を捉えるのに限界があった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。