Skip to main content
QUICK REVIEW

[論文レビュー] LongDanceDiff: Long-term Dance Generation with Conditional Diffusion Model

Siqi Yang, Zejun Yang|arXiv (Cornell University)|Aug 23, 2023
Human Motion and AnimationEngineering被引用数 3
ひとこと要約

LongDanceDiff は、音楽と過去の動きを活用して時間的に整合性があり、多様で現実的なダンスシーケンスを生成する条件付き拡散モデルを提案する。変換器ベースの拡散モデルに部分的ノイズ処理、相互情報量最小化、およびグローバル・トラジェクトリーモデュレーション(GTM)層を組み合わせることで、凍結や足のスライディングの問題を軽減し、長時間のダンス生成タスクにおいて、動きの質と多様性の面で最先端の性能を達成した。

ABSTRACT

Dancing with music is always an essential human art form to express emotion. Due to the high temporal-spacial complexity, long-term 3D realist dance generation synchronized with music is challenging. Existing methods suffer from the freezing problem when generating long-term dances due to error accumulation and training-inference discrepancy. To address this, we design a conditional diffusion model, LongDanceDiff, for this sequence-to-sequence long-term dance generation, addressing the challenges of temporal coherency and spatial constraint. LongDanceDiff contains a transformer-based diffusion model, where the input is a concatenation of music, past motions, and noised future motions. This partial noising strategy leverages the full-attention mechanism and learns the dependencies among music and past motions. To enhance the diversity of generated dance motions and mitigate the freezing problem, we introduce a mutual information minimization objective that regularizes the dependency between past and future motions. We also address common visual quality issues in dance generation, such as foot sliding and unsmooth motion, by incorporating spatial constraints through a Global-Trajectory Modulation (GTM) layer and motion perceptual losses, thereby improving the smoothness and naturalness of motion generation. Extensive experiments demonstrate a significant improvement in our approach over the existing state-of-the-art methods. We plan to release our codes and models soon.

研究の動機と目的

  • 自己回帰モデルにおける誤差蓄積およびトレーニングと推論の乖離によって引き起こされる長期間 3D ダンス生成における凍結問題を解消すること。
  • 特に 2 分程度の長さのシーケンスを対象として、音楽条件下での時間的整合性と空間的リアリズムを向上させること。
  • 過去の動きへの過剰依存を軽減し、過学習や不自然な動きのパターンを回避するために、動きの多様性を向上させること。
  • 空間的制約と知覚損失を用いて、足のスライディングや滑らかでない動きといった視覚的アーティファクトを是正すること。
  • 高精細な動きを維持しつつ、多様で自然なダンスシーケンスを生成できる非自己回帰的、シーケンス・ツー・シーケンスの生成フレームワークを構築すること。

提案手法

  • 変換器ベースの条件付き拡散モデルを採用し、音楽、過去の動き、およびノイズが加えられた未来の動きを連結した入力を用いることで、モダリティ間の依存関係を包括的にモデル化できる。
  • 未来の動きに部分的ノイズ処理を適用し、音楽と過去の動きの文脈に条件づけて、未来の動きを復元できるようにする。
  • 過去の動きと未来の動きの間の相互情報量を最小化する目的関数を導入し、依存性を低減することで、多様性を向上させ、凍結を軽減する。
  • 空間的制約を強制するため、グローバル・トラジェクトリーモデュレーション(GTM)層を統合し、足のスライディングを防止し、グローバルな動きの軌道のリアリズムを向上させる。
  • 位置と速度に基づく動きの知覚損失を用いて、生成された動きが人間の動きの特徴に一致するようにし、滑らかさと自然さを向上させる。
  • 再構築損失、知覚損失、および相互情報量正則化を組み合わせて、エンド・トゥ・エンドで学習することで、忠実度と多様性のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1条件付き拡散モデルは、時間的に整合性があり、空間的にリアリスティックな長期間 3D ダンスシーケンスを効果的に生成できるか?
  • RQ2過去の動きと未来の動きの間の相互情報量最小化は、長時間スパンの生成において多様性を向上させるとともに、凍結を軽減するのに効果的か?
  • RQ3GTM 層による空間的制約は、足のスライディングをどれほど低減させ、グローバルな動きの軌道の忠実度を向上させられるか?
  • RQ4動きの知覚損失の統合は、生成されたダンスの動きの滑らかさと知覚的質にどのように影響を与えるか?
  • RQ5LongDanceDiff は、自己回帰的および非自己回帰的ベースラインと比較して、動きの質、多様性、音楽同期性の面でどのように優れているか?

主な発見

  • ユーザー研究の 90% のケースで、LongDanceDiff は FACT や Li et al.、Revolution を上回り、時間的整合性に優れ、凍結が少ないことが要因であった。
  • 81% のケースで Bailando を上回ったが、主に骨格長の一貫性の向上とより優れた動きの多様性のおかげであった。
  • 高多様性設定下では、75% の比較で Sun et al. を上回り、動きの多様性が向上したことが示された。
  • 60% のケースで EDGE を上回ったが、動きの整合性とスタイルの一貫性が優れていたためであるが、42% の実際の動きは依然として高い評価を受けた。
  • 相互情報量最小化により、凍結率は 27.5% から 24.2% に低下し、過去の動きへの過剰依存の軽減効果が確認された。
  • GTM 層の導入により、運動学的および幾何的特徴の両方の FID スコアが著しく低下し、グローバルな軌道のリアリズムが向上したが、やや多様性に悪影響を与えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。