[論文レビュー] Pretrained Diffusion Models for Unified Human Motion Synthesis
MoFusionは、Transformerバックボーンを備えた事前学習済み拡散モデルを用いた統合的で人間の動きの生成フレームワークを提案する。これにより、テキストや音楽などの多様な制御信号のゼロショット混合が可能となり、テキストから動きへの変換、動きの補完、逆運動学的制御といった複数スケールのタスクをサポートする。事前学習により、過学習を回避しながらより大きなモデルへのスケーリングが可能であり、学習可能なスケルトンアダプタにより、異なるデータセット間のスケルトン差を補正する。
Generative modeling of human motion has broad applications in computer animation, virtual reality, and robotics. Conventional approaches develop separate models for different motion synthesis tasks, and typically use a model of a small size to avoid overfitting the scarce data available in each setting. It remains an open question whether developing a single unified model is feasible, which may 1) benefit the acquirement of novel skills by combining skills learned from multiple tasks, and 2) help in increasing the model capacity without overfitting by combining multiple data sources. Unification is challenging because 1) it involves diverse control signals as well as targets of varying granularity, and 2) motion datasets may use different skeletons and default poses. In this paper, we present MoFusion, a framework for unified motion synthesis. MoFusion employs a Transformer backbone to ease the inclusion of diverse control signals via cross attention, and pretrains the backbone as a diffusion model to support multi-granularity synthesis ranging from motion completion of a body part to whole-body motion generation. It uses a learnable adapter to accommodate the differences between the default skeletons used by the pretraining and the fine-tuning data. Empirical results show that pretraining is vital for scaling the model size without overfitting, and demonstrate MoFusion's potential in various tasks, e.g., text-to-motion, motion completion, and zero-shot mixing of multiple control signals. Project page: \url{https://ofa-sys.github.io/MoFusion/}.
研究の動機と目的
- テキストから動きへの変換、動きの補完、逆運動学的制御といった多様な人間の動き生成タスクを、1つのスケーラブルなモデルに統合すること。
- 複数のデータセットに跨る大規模な事前学習を活用することで、動きモデリングにおけるデータ不足や過学習を克服すること。
- 共同教師なしの条件下で、制御信号(例:テキストと音楽)を組み合わせることで、ゼロショットでのスキルの組み合わせを可能にすること。
- 異なるスケルトンやデフォルトポーズの差異を含む動きデータセットの変動性に対処するため、学習可能なスケルトンアダプタを導入すること。
- 大規模モデルが、各タスクのデータが限られている状況でも、過学習を回避しながら効果的に訓練可能であることを実証すること。
提案手法
- MoFusionは、テキスト、音楽、関節位置などの多様な制御信号を条件付けた生成に、クロスアテンションを用いるTransformerベースの拡散モデルを採用する。
- モデルは、x₀予測バージョンの拡散損失を用いて、大規模な動きデータコーパス上で事前学習され、データはヒューリスティックにSMPL-Hに類似したスケルトンにリターゲティングされる。
- 学習可能なスケルトンアダプタを導入し、事前学習データと微調整データ間の関節表現の一致と、デフォルトポーズの差を補正する。
- フレームワークは、全身の生成(完全なノイズ除去)と特定ボディパーツのマスク付きノイズ除去による部分的編集という、複数スケールの生成をサポートする。
- 交互に制御信号を介してアテンションを切り替える戦略により、生成プロセス中に複数の制御信号(例:テキストと音楽)をゼロショットで混合可能となる。
- 動きの中間生成タスクにおける不連続性を低減するため、デルタインペイント損失と微調整目的関数といった後処理技術が適用される。
実験結果
リサーチクエスチョン
- RQ11つの統合モデルが、異なる制御信号とターゲットの粒度を持つ多様な動き生成タスクを効果的に処理できるか?
- RQ2多様な動きデータに対するマルチタスク事前学習により、共同教師なしの条件下でテキストと音楽の制御信号を組み合わせたゼロショット一般化が可能か?
- RQ3各タスクのデータが限られている状況でも、大規模な動きモデルが過学習を回避しながら効果的に訓練可能か?
- RQ4手動リターゲティングや単純なMLPと比較して、学習可能なスケルトンアダプタは、異なるデータセット間のスケルトン差をどれほど効果的に処理できるか?
- RQ5事前学習が、下流タスクのパフォーマンスを維持したまま、モデルサイズのスケーリングをどの程度可能にするか?
主な発見
- 事前学習により、モデルサイズのスケーリングが効果的に可能である—例として、250Mパラメータのモデルが事前学習なしの小規模モデルを上回る性能を示しており、過学習が大規模事前学習によって緩和されることを示している。
- 提案されたスケルトンアダプタは、手動リターゲティングと同等の性能を達成しており、事前学習なしでは一般化に失敗する単純なMLPベースラインと比較して顕著に優れている。
- MoFusionは、テキストと音楽の制御信号のゼロショット混合に対して、一貫性のある動きを生成できており、ハイパーパrameter γが信号間のバランスを効果的に制御している。
- デルタインペイント損失と微調整目的関数は、中間生成タスクにおける動きの不連続性を顕著に低減し、標準的なRePaintやベースライン手法を上回る性能を示している。
- 実験的結果から、MoFusionはテキストから動きへの変換、動きの補完、逆運動学的制御といったタスクにわたり、一貫した性能向上を示しており、一般化能力が優れていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。