[論文レビュー] MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators
MotionGPT は、テキストとシングルフレームポーズというマルチモーダル制御信号を、離散トークンに変換して大規模言語モデル(LLM)にプロンプトすることで、人間の動きを生成する統合的で一貫した動き生成フレームワークです。LoRA を用いてわずか 0.4% のパラメータのみをファインチューニングすることで、イン-between、継続、キーポーズ条件付き生成など、多様なタスクにおける柔軟な動き生成を実現し、最先端の性能を達成しています。
Generating realistic human motion from given action descriptions has experienced significant advancements because of the emerging requirement of digital humans. While recent works have achieved impressive results in generating motion directly from textual action descriptions, they often support only a single modality of the control signal, which limits their application in the real digital human industry. This paper presents a Motion General-Purpose generaTor (MotionGPT) that can use multimodal control signals, e.g., text and single-frame poses, for generating consecutive human motions by treating multimodal signals as special input tokens in large language models (LLMs). Specifically, we first quantize multimodal control signals into discrete codes and then formulate them in a unified prompt instruction to ask the LLMs to generate the motion answer. Our MotionGPT demonstrates a unified human motion generation model with multimodal control signals by tuning a mere 0.4% of LLM parameters. To the best of our knowledge, MotionGPT is the first method to generate human motion by multimodal control signals, which we hope can shed light on this new direction. Visit our webpage at https://qiqiapink.github.io/MotionGPT/.
研究の動機と目的
- 既存の動き生成モデルがテキストやポーズのいずれかの制御モダリティのみをサポートするという制限に対処すること。
- テキスト記述とキーフレームポーズを含む複数の制御信号に条件づけた人間の動きシーケンスを生成できる統合フレームワークの開発。
- マルチモーダル入力をプロンプトベースの指示チューニングパラダイムにおける離散トークンとして扱うことで、事前学習済み LLM を動き生成に適応させる可能性の調査。
- 複数の制御条件での共同学習が、多様な動き生成タスクにおける汎化性と性能向上に寄与することの実証。
- 訓練時間とパラメータ更新を最小限に抑えつつ、高品質な出力を維持するスケーラブルで効率的な動き生成手法の確立。
提案手法
- MotionGPT は、事前学習済みの VQ-VAE を用いて人間の動きシーケンスを離散コードに量子化し、ポーズシーケンスをトークンシーケンスとして表現可能にする。
- テキストとポーズコードというマルチモーダル入力を、LLM の入力トークンとして扱う統一されたプロンプトインstruct に統合する。
- LLM のパラメータのわずか 0.4% のみをファインチューニングするために LoRA(低ランク適応)を採用し、事前学習済みモデルの動きの事前知識を保持しながら、動き生成に適応させる。
- テキスト指示と初期または中間のポーズフレームの両方に条件づけた動きシーケンスの予測を、エンドツーエンドで学習する。
- イン-between、継続、初期ポーズからの生成といった多様なタスクを処理できる統一された指示チューニングフレームワークを設計する。
- LLM の自己回帰的性質と可変長出力生成能力を活用することで、柔軟な動き長さの生成を実現する。
実験結果
リサーチクエスチョン
- RQ11 つの統合的 LLM ベースのモデルが、テキストとシングルフレームポーズ入力の両方に条件づけた人間の動きシーケンスを効果的に生成できるか?
- RQ2テキストとポーズという複数の制御モダリティを共同で学習させることで、個別に学習させる場合よりも性能が向上するか?
- RQ3最小限のパrameter更新と低コストな訓練で、事前学習済み LLM を動き生成に効果的に適応できるか?
- RQ4LoRA のハイパーパramータ(r と α)の選択が、動き生成の品質と訓練効率にどのように影響するか?
- RQ5モデルが、継続、イン-between、ポーズ条件付き生成といった多様な動き生成タスクにどれほど汎化できるか?
主な発見
- MotionGPT は、7B パラメータモデルを用いて HumanML3D および KIT-ML データセットで最先端の性能を達成し、FID が 0.590、MM Dist が 3.796 となった。
- テキストとポーズの複数の制御条件での共同学習は、個別学習と比較してすべての指標で顕著な性能向上をもたらし、FID は 0.180 減少、MM Dist は 0.471 減少した。
- わずか 3300 万個のトレーニング可能なパラメータ(全 LLM の 0.4%)で優れた結果を達成し、訓練時間は約 4 時間で、先行手法の 10% にまで短縮された。
- α/r の比率を維持しながら LoRA ランク(r)を増加させることで性能が向上し、最適な結果は α=16、r=16 以上で得られた。
- モデルは強力な汎化性能を示し、動きの継続、イン-between、ポーズ条件付き生成といったタスクにおいて、高多様性かつ高忠実度の動きシーケンスを生成した。
- プロンプトにキーポーズトークン(例:初期および最終ポーズ)を組み込むことで、個別学習と比較して R-Precision が 0.045 上昇し、多様性が 0.647 上昇した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。