Skip to main content
QUICK REVIEW

[論文レビュー] Taming Diffusion Models for Audio-Driven Co-Speech Gesture Generation

Lingting Zhu, Xian Liu|arXiv (Cornell University)|Mar 16, 2023
Speech and Audio Processing被引用数 7
ひとこと要約

本稿では、音声駆動型共話ジェスチャー生成のための拡散モデルベースのフレームワークであるDiffGestureを提案する。本手法は、音声とジェスチャーのクロスモーダルな依存関係をモデル化するためのDiffusion Audio-Gesture Transformerと、時間的整合性を保証するためのDiffusion Gesture Stabilizerを活用する。暗黙の分類器フリー正則化を組み込むことで、ベンチマークデータセット上で、より優れた多様性、音声相関性、ジェスチャー品質を実現し、最先端の性能を達成した。

ABSTRACT

Animating virtual avatars to make co-speech gestures facilitates various applications in human-machine interaction. The existing methods mainly rely on generative adversarial networks (GANs), which typically suffer from notorious mode collapse and unstable training, thus making it difficult to learn accurate audio-gesture joint distributions. In this work, we propose a novel diffusion-based framework, named Diffusion Co-Speech Gesture (DiffGesture), to effectively capture the cross-modal audio-to-gesture associations and preserve temporal coherence for high-fidelity audio-driven co-speech gesture generation. Specifically, we first establish the diffusion-conditional generation process on clips of skeleton sequences and audio to enable the whole framework. Then, a novel Diffusion Audio-Gesture Transformer is devised to better attend to the information from multiple modalities and model the long-term temporal dependency. Moreover, to eliminate temporal inconsistency, we propose an effective Diffusion Gesture Stabilizer with an annealed noise sampling strategy. Benefiting from the architectural advantages of diffusion models, we further incorporate implicit classifier-free guidance to trade off between diversity and gesture quality. Extensive experiments demonstrate that DiffGesture achieves state-of-theart performance, which renders coherent gestures with better mode coverage and stronger audio correlations. Code is available at https://github.com/Advocate99/DiffGesture.

研究の動機と目的

  • GANベースの手法が音声駆動型ジェスチャー生成において抱える問題、例えばモード崩壊や不安定な学習の制限を解消すること。
  • 通常は静的データに用いられる拡散モデルを、連続的な音声クリップを条件として、時間的整合性があり高精細なジェスチャー列を生成するように適応すること。
  • 音声とジェスチャーの間のクロスモーダルな整合性を向上させるために、音声とスケルトン列の両方における長期的な時間的依存関係をモデル化すること。
  • 標準的な拡散推論におけるi.i.d.ノイズサンプリングが引き起こす時間的不整合を解消すること。
  • 暗黙の分類器フリー正則化により、ジェスチャーの多様性と品質の間の制御可能なトレードオフを可能とすること。

提案手法

  • スケルトン列と音声のクリップを条件とする拡散プロセスとしてジェスチャー生成タスクを定式化し、音声条件付きのコンテキスト特徴量を用いてノイズを徐々に追加し、その後に除去する。
  • フレームごとのスケルトン特徴量と音声特徴量を時間軸に沿って連結し、Transformerエンコーダーで処理することで、長距離依存関係をモデル化するDiffusion Audio-Gesture Transformerを設計する。
  • 時間的不整合を低減し、動きのなめらかさを向上させるために、段階的(アナールド)なノイズサンプリング戦略を適用するDiffusion Gesture Stabilizerモジュールを導入する。
  • 条件付きおよび非条件付きの拡散モデルを同時に学習することで、暗黙の分類器フリー正則化を実装し、推論時に多様性と忠実度の間の調整可能なトレードオフを可能にする。
  • 誤差の累積を回避し、効率的なエンドツーエンドの全ジェスチャークリップ合成を実現するため、非自己回帰的生成パイプラインを採用する。
  • TED GestureおよびTED Expressiveベンチマークを活用し、大規模な音声-ジェスチャーデータセット上でエンドツーエンドでモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1連続的な音声入力条件下で、拡散モデルが高精細で時間的整合性を持つ共話ジェスチャーを効果的に生成できるか。
  • RQ2シーケンス・ツー・シーケンス生成フレームワークにおいて、音声とジェスチャーのクロスモーダル依存関係を効果的にモデル化するにはどうすればよいか。
  • RQ3生成されたスケルトン列における時間的不整合を防ぐために、どのメカニズムが拡散プロセスを安定化させられるか。
  • RQ4暗黙の分類器フリー正則化は、ジェスチャー生成における多様性と品質のバランスをどの程度改善できるか。
  • RQ5GANベースのベースラインと比較して、本フレームワークはモードカバレッジ、音声相関性、および知覚的品質の観点でどの程度優れているか。

主な発見

  • DiffGestureは、TED GestureおよびTED Expressiveの両データセットで最先端の性能を達成し、すべての主要指標において従来のGANベース手法を上回った。
  • TED Gestureでは1.506のFrećhet Gesture Distance(FGD)を達成し、次善のベースラインを顕著に上回った。
  • TED Expressiveでは0.718のBoundary Coverage(BC)スコアを達成し、強力なモードカバレッジとモード崩壊の低減を示した。
  • TED Expressiveでは多様性指標が182.757に達し、多様で表現力のあるジェスチャーを生成する優れた能力を示した。
  • ユーザースタディの結果、人間の評価者により、自然さ、滑らかさ、同期性の平均スコアが5段階中4.5と高く評価され、高い知覚的品質を示した。
  • アブレーションスタディの結果、Diffusion Gesture Stabilizerおよび暗黙の分類器フリー正則化の両方が、高い性能を達成するために不可欠であることが確認され、それらを除去するとFGDおよびBCに顕著な低下が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。