Skip to main content
QUICK REVIEW

[論文レビュー] Modiff: Action-Conditioned 3D Motion Generation with Denoising Diffusion Probabilistic Models

Mengyi Zhao, Mengyuan Liu|arXiv (Cornell University)|Jan 10, 2023
Human Motion and Animation被引用数 5
ひとこと要約

Modiffは、アクションカテゴリを入力として用いることで、多様で現実的なスケルトンシーケンスを合成する、条件付き3次元運動生成のためのノイズ除去拡散確率的モデル(DDPM)を提案する。NTU RGB+Dデータセットにおいて最先端の性能を達成し、Kinetic-GAN⋆と比較してFMDを64.49点低減した。

ABSTRACT

Diffusion-based generative models have recently emerged as powerful solutions for high-quality synthesis in multiple domains. Leveraging the bidirectional Markov chains, diffusion probabilistic models generate samples by inferring the reversed Markov chain based on the learned distribution mapping at the forward diffusion process. In this work, we propose Modiff, a conditional paradigm that benefits from the denoising diffusion probabilistic model (DDPM) to tackle the problem of realistic and diverse action-conditioned 3D skeleton-based motion generation. We are a pioneering attempt that uses DDPM to synthesize a variable number of motion sequences conditioned on a categorical action. We evaluate our approach on the large-scale NTU RGB+D dataset and show improvements over state-of-the-art motion generation methods.

研究の動機と目的

  • アクションタイプに条件づけられた多様で現実的かつ制御可能な3次元人体運動シーケンスを生成する課題に対処すること。
  • スケルトンベースの運動生成という、拡散確率的モデルが未だあまり検討されていない分野において、その可能性を調査すること。
  • DDPMのノイズ除去プロセスを活用することで、より優れたサンプル品質と多様性を実現する、既存の生成モデルの性能を改善すること。
  • 条件付き逆マルコフ連鎖を用いて、一貫性のあるアクション意味論を持つ可変長運動シーケンス生成を可能にすること。
  • 大規模データセット上での拡散モデルを用いた、アクション条件付き3次元運動生成の新しい最先端のベースラインを確立すること。

提案手法

  • Modiffは、3次元スケルトンシーケンスに徐々にガウスノイズを加える前向きのノイズ付与プロセスを学習するため、ノイズ除去拡散確率的モデル(DDPM)を採用する。
  • 逆プロセスでは、アクションカテゴリをクラス条件付きラベル埋め込みによって条件づけたU-Netアーキテクチャを用いて、段階的にノイズを除去する。
  • トレーニングおよび推論中に、3次元スケルトンシーケンスを2次元の空間的・時間的特徴マップとして扱い、畳み込み演算を活用する。
  • 空間的および時間的整合性を保つために、スキップ接続を備えた条件付きU-Netを用いる。
  • L1およびL2損失関数の組み合わせを用いてノイズ除去プロセスを監視し、アブレーション実験によりL1損失がより良いFMDスコアをもたらすことが示された。
  • アクションラベルは、Hoら[34]の手法に基づく学習可能埋め込み層を用いてエンコードされ、従来のラベル埋め込み手法よりも性能が向上した。

実験結果

リサーチクエスチョン

  • RQ1ノイズ除去拡散モデルは、アクションカテゴリに条件づけられた多様で現実的な3次元人体運動シーケンスを効果的に生成できるか?
  • RQ2損失関数の選択(L1対L2)は、生成された運動シーケンスの品質および多様性にどのように影響するか?
  • RQ3U-Netアーキテクチャの違い(例:深さおよび幅)は、運動生成性能にどのような影響を及えるか?
  • RQ4ラベル埋め込み戦略は、モデルの異なるアクションクラスへの一般化能力にどのように影響するか?
  • RQ5拡散モデルは、既存のGANベースおよびVAEベースのアプローチを上回る性能を発揮できるか?

主な発見

  • ModiffはNTU RGB+Dデータセット上でFMDスコア9.42 ± 0.00を達成し、Kinetic-GAN⋆(FMD = 73.91)およびKinetic-GAN-MLP8(FMD = 82.88)を著しく上回った。
  • アブレーションスタディの結果、L2損失と比較してL1損失を用いることでFMDが6.28点低減し、再構成忠実度の向上が示された。
  • U-Netの潜在チャネル数を16から64に増加させることでFMDが145.74点低減し、表現力のある潜在表現の重要性が裏付けられた。
  • Hoら[34]の手法に基づくラベル埋め込みは、[29]で用いられた手法と比較してFMDを0.3点改善し、条件付きモデリングにおける有効性を確認した。
  • 定性的な結果では、Modiffは一貫したリズム、現実的な関節ダイナミクス、明確なアクション意味(例:「敬礼」や「前で両手を交差」)を持つ運動シーケンスを生成した。
  • 改善が見られたが、一部のサンプルではジターリングや早期/遅延クラッシュが依然として観察され、時間的安定性の向上に余地があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。