Skip to main content
QUICK REVIEW

[論文レビュー] DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models

Sicheng Yang, Zhiyong Wu|arXiv (Cornell University)|May 8, 2023
Human Motion and Animation被引用数 5
ひとこと要約

DiffuseStyleGesture は、WavLM 音声特徴量とクロスローカルおよび自己注意メカニズムを活用することで、音声に一致する高品質でスタイリッシュかつ多様なジェスチャーを生成する、拡散モデルベースのアプローチを提案する。分類器フリー正則化を用いたスタイル補間および初期ジェスチャー操作による細かい制御が可能であり、人間らしさと音声適合性において先行手法を上回る性能を発揮する。

ABSTRACT

The art of communication beyond speech there are gestures. The automatic co-speech gesture generation draws much attention in computer animation. It is a challenging task due to the diversity of gestures and the difficulty of matching the rhythm and semantics of the gesture to the corresponding speech. To address these problems, we present DiffuseStyleGesture, a diffusion model based speech-driven gesture generation approach. It generates high-quality, speech-matched, stylized, and diverse co-speech gestures based on given speeches of arbitrary length. Specifically, we introduce cross-local attention and self-attention to the gesture diffusion pipeline to generate better speech matched and realistic gestures. We then train our model with classifier-free guidance to control the gesture style by interpolation or extrapolation. Additionally, we improve the diversity of generated gestures with different initial gestures and noise. Extensive experiments show that our method outperforms recent approaches on speech-driven gesture generation. Our code, pre-trained models, and demos are available at https://github.com/YoungSeng/DiffuseStyleGesture.

研究の動機と目的

  • 音声のリズムと意味を両方とも適合させる、多様で現実的かつ音声に整合する共話ジェスチャーを生成する課題に対処すること。
  • GAN、VAE、フローベースモデルにおけるジェスチャー生成の限界、特にモード崩壊や品質と多様性のトレードオフを克服すること。
  • 分類器フリー正則化を用いて、スタイル補間および初期ジェスチャー制御による制御可能なジェスチャー生成を実現すること。
  • 局所的およびグローバルな依存関係を捉える注意メカニズムを用いて、音声とジェスチャーの間の時間的整合性を向上させること。
  • WavLM 音声特徴量から得られる意味的および感情的情報を統合することで、モデルの頑健性と一般化性能を向上させること。

提案手法

  • モデルは、音声(WavLM 特徴量経由)、初期ジェスチャー、およびスタイル埋め込みを条件として、時間的に整合したジェスチャーを生成するためのノイズ除去拡散プロセスを採用する。
  • クロスローカル注意は、音声特徴量とジェスチャー特徴量の間の短距離相関を捉えるために用いられ、局所的な同期性を向上させる。
  • 自己注意は、長距離の時間的依存関係をモデル化するために適用され、任意長の音声入力に対応したジェスチャー生成を可能にする。
  • 分類器フリー正則化は、訓練時にランダムマスクを用いて実装され、スタイルおよび初期ジェスチャー条件の補間および外挿を可能にする。
  • モデルはノイズを直接予測するのではなく、ノイズ除去されたジェスチャー列を予測することで、訓練の安定性と生成品質を向上させる。
  • アーキテクチャは、反復的なノイズ除去によってデータ分布を学習することで高精細なジェスチャーを生成するように訓練され、注意メカニズムが音声-ジェスチャー整合性を強化する。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルは、任意長の音声入力に対して、多様で高品質かつ音声に一致する共話ジェスチャーを効果的に生成できるか?
  • RQ2クロスローカルおよび自己注意メカニズムは、音声とジェスチャー列の間の時間的整合性をどのように向上させるか?
  • RQ3分類器フリー正則化を用いることで、ジェスチャー生成におけるスタイル編集および初期ジェスチャー操作の制御性はどの程度向上するか?
  • RQ4従来の MFCC などの音声特徴量と比較して、WavLM 特徴量の統合はジェスチャー生成の品質と頑健性を向上させるか?
  • RQ5前方注意(forward attention)が性能を劣化させる理由は何か?これは、人間のジェスチャー生成の時間的ダイナミクスについて何を示唆するか?

主な発見

  • 完全な DiffuseStyleGesture モデルは、人間らしさスコア 4.11 ± 0.08 および音声適合性 4.11 ± 0.10 を達成し、アブレーションモデルを顕著に上回る性能を示す。
  • WavLM 特徴量を除去すると、音声適合性は 3.91 ± 0.11 に低下し、意味的および感情的音声特徴量が整合性に不可欠であることが示される。
  • クロスローカル注意を除去すると、性能が急激に低下(人間らしさ:3.76 ± 0.09、適合性:3.51 ± 0.15)し、局所的ジェスチャー-音声同期にその重要性が証明される。
  • 自己注意を除去すると、最も悪い性能(人間らしさ:3.55 ± 0.13、適合性:3.08 ± 0.10)を示し、長距離依存関係のモデル化におけるその重要性が明らかになる。
  • 注意機構を GRU ベースのモデリングに置き換えると、最低のスコア(3.10 ± 0.11 および 2.98 ± 0.14)が得られ、このタスクにおける注意機構の優位性が確認される。
  • 前方注意はクロスローカル注意よりも性能が劣り、ジェスチャーが主に現在および過去の音声に影響を受けることが示唆され、人間の運動計画と整合する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。