[論文レビュー] Listen, Denoise, Action! Audio-Driven Motion Synthesis with Diffusion Models
本論文は、音声駆動型3次元人体運動生成のための拡散モデルベースのフレームワークを提案する。Conformerアーキテクチャを用いて複雑な運動シーケンスをモデル化し、スタイル制御のための分類器フリー正則化を適用する。ジェスチャーおよびダンス生成において最先端の運動品質を達成し、スタイル表現の制御可能性と、新しいエキスパートの積による補間・モデル結合が可能となる。
Diffusion models have experienced a surge of interest as highly expressive yet efficiently trainable probabilistic models. We show that these models are an excellent fit for synthesising human motion that co-occurs with audio, e.g., dancing and co-speech gesticulation, since motion is complex and highly ambiguous given audio, calling for a probabilistic description. Specifically, we adapt the DiffWave architecture to model 3D pose sequences, putting Conformers in place of dilated convolutions for improved modelling power. We also demonstrate control over motion style, using classifier-free guidance to adjust the strength of the stylistic expression. Experiments on gesture and dance generation confirm that the proposed method achieves top-of-the-line motion quality, with distinctive styles whose expression can be made more or less pronounced. We also synthesise path-driven locomotion using the same model architecture. Finally, we generalise the guidance procedure to obtain product-of-expert ensembles of diffusion models and demonstrate how these may be used for, e.g., style interpolation, a contribution we believe is of independent interest. See https://www.speech.kth.se/research/listen-denoise-action/ for video examples, data, and code.
研究の動機と目的
- ダンスや共話ジェスチャーのように、運動が高次元的で曖昧かつ個別的である文脈において、高品質で多様性に富み、スタイル表現が可能な3次元人体運動を生成する課題に対処すること。
- 音声駆動運動の複雑で非決定的である性質を捉えることが可能な確率的生成モデルを開発し、決定的または非確率的アプローチの限界を克服すること。
- 分類器フリー正則化を用いて、スタイル表現の強度を調整可能な制御可能な運動生成を実現すること。
- ガイドラインメカニズムを一般化し、新しいタスク(例:スタイル補間やモデル結合)に適応可能な拡散モデルのエキスパートの積によるアンサンブルを可能にすること。
- 今後の研究のための貴重なベンチマークを提供する、複数のダンスジャンルをカバーする高品質な音声・3次元モーションキャプチャデータセットを公開すること。
提案手法
- 拡散モデルのDiffWaveアーキテクチャを3次元人体ポーズシーケンスに適応させ、拡張畳み込みをConformerに置き換えることで、運動データにおける長距離時系列依存性のモデル化を向上させる。
- 音声埋め込みをConformerベースの音声エンコーダーで抽出し、その条件のもとで、ノイズが付加された運動シーケンスを繰り返し精錬するためのノイズ除去U-Netバックボーンを用いる。
- サンプリング中に分類器フリー正則化を適用し、クラスラベルあり・なしの出力を比較することで、スタイル表現の強度を制御する。
- 複数の拡散モデルをスコア関数の重み付き幾何平均によって結合することで、エキスパートの積によるアンサンブルフレームワークを導入し、多様な運動スタイルの補間と統合を可能にする。
- 異なるノイズレベルでの運動シーケンスの正確な再構成を促進するマルチスケール学習目的を採用し、サンプル品質と学習安定性を向上させる。
- すべてのアンサンブルモデルを同じ音声エンコーダーで条件づけることで、異なるエキスパート構成間で一貫した音声-運動アライメントを保証する。
実験結果
リサーチクエスチョン
- RQ1拡散モデルは、ダンスや共話ジェスチャーのような高次元的で曖昧かつ個別的な音声駆動人体運動の性質を効果的にモデル化できるか?
- RQ2音声駆動運動生成における標準的な畳み込みアーキテクチャと比較して、Conformerベースのアーキテクチャは運動モデリング性能を向上させられるか?
- RQ3分類器フリー正則化は、音声駆動運動生成におけるスタイル表現の強度を効果的に制御するために適用可能か?
- RQ4拡散モデルのエキスパートの積によるアンサンブルフレームワークは、滑らかなスタイル補間や多様な運動スタイルの統合といった新しい機能を実現できるか?
- RQ5提案手法はパス駆動歩行に一般化可能であり、ジェスチャーおよびダンス生成を超えたより広範な応用性を示せるか?
主な発見
- 提案手法は、複数のジェスチャーおよびダンスデータセットにおいて、定量的指標と定性的評価の両面で、最先端の運動品質を達成した。
- 分類器フリー正則化により、スタイル表現の強度を効果的かつ制御可能に調整でき、ユーザーが望む出力特性に応じてより表現的または控えめな運動を生成できる。
- エキスパートの積によるアンサンブルフレームワークは、一貫性があり、知覚的に妥当な中間運動を生成するスタイル間補間を成功裏に実現した。
- 本手法はパス駆動歩行に良好に一般化され、ダンスおよびジェスチャー生成を超えた、ロバストで適応性の高い性能を示した。
- 複数のダンスジャンルからなる高品質な3次元運動と音声ペアデータセットを公開し、今後の研究のための貴重なベンチマークを提供した。
- 本フレームワークは効率的な推論をサポートしており、音声に加えてテキストを条件として用いることで意味的ジェスチャー合成など、マルチモーダル生成への拡張も可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。