[論文レビュー] MotionMixer: MLP-based 3D Human Body Pose Forecasting
MotionMixer は、空間的・時間的混合を活用して関節および時間的依存関係を捉える、マルチレイヤーパーセプトロン(MLP)のみに依存する新しい 3D 人体ポーズ予測モデルを提案する。このモデルは、Human3.6M、AMASS、3DPW で最先端の性能を達成しており、従来の手法と比較して大幅に少ないパラメータ数で、最大 4% の誤差低減を達成している。一方、次に優れたモデルの 0.5% のパラメータ数しか使用していない。
In this work, we present MotionMixer, an efficient 3D human body pose forecasting model based solely on multi-layer perceptrons (MLPs). MotionMixer learns the spatial-temporal 3D body pose dependencies by sequentially mixing both modalities. Given a stacked sequence of 3D body poses, a spatial-MLP extracts fine grained spatial dependencies of the body joints. The interaction of the body joints over time is then modelled by a temporal MLP. The spatial-temporal mixed features are finally aggregated and decoded to obtain the future motion. To calibrate the influence of each time step in the pose sequence, we make use of squeeze-and-excitation (SE) blocks. We evaluate our approach on Human3.6M, AMASS, and 3DPW datasets using the standard evaluation protocols. For all evaluations, we demonstrate state-of-the-art performance, while having a model with a smaller number of parameters. Our code is available at: https://github.com/MotionMLP/MotionMixer
研究の動機と目的
- RNN、CNN、GCN に依存しない、完全に MLP のみを用いた 3D 人体ポーズ予測モデルの開発。
- 統合された MLP アーキテクチャを用いて、空間的関節関係と時間的運動ダイナミクスを効率的にモデル化すること。
- モデルの複雑さと計算コストを低減しつつ、予測精度を維持または向上させること。
- スイープ・エキスカーションブロックを用いて、入力シーケンスにおける各時間ステップの重要性を補正し、長期予測の精度を向上させること。
- 最小限のパラメータ数で、標準ベンチマークで最先端の性能を達成すること。
提案手法
- モデルは二段階の MLP アーキテクチャを採用:空間 MLP は各時間ステップにおける関節座標を処理し、微細な空間的依存関係を抽出する。
- 時間 MLP は時間ステップ間の相互作用をモデル化し、運動ダイナミクスを捉える。
- 空間的および時間的特徴は、共有された MLP を用いた混合機構を通じて混合され、空間的および時間的依存関係の統合的モデリングが可能になる。
- スイープ・エキスカーション(SE)ブロックを適用し、シーケンス内の各時間ステップの影響を再補正することで、重要なポーズへの注目を向上させる。
- モデルはスタックされた 3D ポーズシーケンスを処理し、最終的な MLP ヘッドを用いて将来のポーズをデコードする。
- 3D 関節位置の平均二乗誤差損失を用いて、エンド・トゥ・エンドでモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1純粋な MLP アーキテクチャは、従来の RNN、CNN、GCN に基づくモデルを上回る性能を発揮できるか?
- RQ2MLP を用いた空間的・時間的混合は、複雑な人体運動ダイナミクスをどれほど効果的に捉えられるか?
- RQ3スイープ・エキスカーションブロックによる時間的注目度の再補正は、長期予測精度をどの程度向上させるか?
- RQ4軽量な MLP モデルは、従来の手法と比較して大幅に少ないパラメータ数で最先端の性能を達成できるか?
- RQ5モデルは Human3.6M、AMASS、3DPW のような多様なアクティビティとデータセットに対して、どの程度一般化できるか?
主な発見
- MotionMixer は、Human3.6M、AMASS、3DPW で最先端の性能を達成し、従来の最先端モデルと比較して平均 3.5mm の 3D 誤差低減を実現した。
- 1000ms の予測ホライズンにおいて、MotionMixer は Human3.6M で平均 71.6mm の 3D 誤差を達成し、次に優れたモデルと比較して 4% の誤差低減を達成した。
- 25 フレームを予測する際、モデルはたった 30.2k パラメータと 2.1M FLOPs のみを用い、71.6mm の誤差を達成した。これは 57.5k パラメータを持つモデルよりも 3.8mm の誤差低減を達成した。
- 空間的または時間的混合を削除すると、それぞれ 1000ms 時に誤差が 4% および 6% 増加し、両者の統合的モデリングの必要性が確認された。
- スイープ・エキスカーションブロックの導入により、全ホライズンで誤差が 2mm 減少し、時間的再補正の有効性が裏付けられた。
- ポーズの相対変位表現を用いることで、5mm の性能向上が達成され、未学習の被験者や環境への一般化性能が向上したことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。