[論文レビュー] WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion
WHAMは、モノクロナルビデオから3次元人体運動をグローバル座標でリアルタイムかつ高精度に再構築するための手法を提案する。2次元キーポイント列、ビデオ特徴、SLAMからのカメラの角速度、接触感知トラジェクトリーリファイニングを組み合わせた手法であり、フットスライディングを回避しながら、屋外環境のベンチマークで最先端の性能を達成する。
The estimation of 3D human motion from video has progressed rapidly but current methods still have several key limitations. First, most methods estimate the human in camera coordinates. Second, prior work on estimating humans in global coordinates often assumes a flat ground plane and produces foot sliding. Third, the most accurate methods rely on computationally expensive optimization pipelines, limiting their use to offline applications. Finally, existing video-based methods are surprisingly less accurate than single-frame methods. We address these limitations with WHAM (World-grounded Humans with Accurate Motion), which accurately and efficiently reconstructs 3D human motion in a global coordinate system from video. WHAM learns to lift 2D keypoint sequences to 3D using motion capture data and fuses this with video features, integrating motion context and visual information. WHAM exploits camera angular velocity estimated from a SLAM method together with human motion to estimate the body's global trajectory. We combine this with a contact-aware trajectory refinement method that lets WHAM capture human motion in diverse conditions, such as climbing stairs. WHAM outperforms all existing 3D human motion recovery methods across multiple in-the-wild benchmarks. Code will be available for research purposes at http://wham.is.tue.mpg.de/
研究の動機と目的
- 既存の3次元人体モーション推定手法がカメラ座標系で動作し、フットスライディングや高コストな最適化に悩まされるという限界を解消すること。
- 任意のカメラ運動を伴うモノクロナルビデオから、正確で効率的かつグローバルに一貫性のある3次元人体モーション再構築を可能にすること。
- ビデオおよびモーションキャプチャデータからの時間的文脈を活用することで、1フレームごとの手法を凌駆する精度向上を実現すること。
- 接触感知トラジェクトリーリファイニングを組み込むことで、グローバルトラジェクトリーフットスライディングを解消すること。
- 高速でエンドツーエンドの学習ベースパイプラインにより、AR/VR、ロボット工学、自律システムなどのリアルタイム応用を支援すること。
提案手法
- WHAMは、AMASSデータセット上でモーションエンコーダーとデコーダーを事前学習し、2次元キーポイント列を3次元SMPLパラメータに変換することで、長距離の運動文脈を捉える。
- 2次元キーポイント列と時間的ビデオ特徴を融合するための特徴統合ネットワークを導入し、ポーズおよびスケール推定の精度を向上させる。
- SLAMまたはジャイロスコープからのカメラの角速度と予測された運動文脈を組み合わせることで、グローバルな人体トラジェクトリーパラメータを推定する。
- グローバルトラジェクトリーデコーダーが、運動文脈とカメラの角速度を用いて、人体の向きとルート速度を再帰的に予測することで、グローバル座標推定を実現する。
- 接触感知トラジェクトリーリファイニングを適用し、実際の足と地面の接触を強制することで、上り坂などでの足のスライディングを低減する。
- 3Dの真値を備えたビデオデータセットを用いてエンドツーエンドで学習し、データ合成時にランダムマスキングを導入することで、耐障害性を向上させる。

実験結果
リサーチクエスチョン
- RQ1高価な最適化に依存せずに、学習ベースの手法がモノクロナルビデオからグローバル座標での正確な3次元人体モーション推定を達成できるか?
- RQ22次元キーポイントからの運動文脈を、密度の高い視覚的特徴と効果的に統合することで、3次元ポーズおよびスケール推定の精度を向上させられるか?
- RQ3SLAMまたはジャイロスコープからのカメラの角速度を用いることで、人体運動とカメラ運動を分離し、正確なグローバルトラジェクトリーエstimatationを実現できるか?
- RQ4ステップ上りなどの複雑な動きにおいて、接触感知リファイニングがグローバルトラジェクトリーフットスライディングを顕著に低減できるか?
- RQ5モーションキャプチャデータで学習した手法が、屋外ビデオに一般化しながらも、高い精度とリアルタイム性能を維持できるか?
主な発見
- WHAMは、複数の屋外環境ベンチマークで最先端の性能を達成し、画像ベースおよび動画ベースの両手法を凌駆する3次元ポーズおよびグローバルトラジェクトリーエラーの低さを実現した。
- アブレーションスタディの結果、特徴統合により、ベースラインと比較してルートトランスレーション誤差が14.8%低減され、フット速度誤差が19.8%低減された。
- AMASSでの事前学習を削除すると、性能が著しく低下し、運動文脈学習の重要性が示された。
- トラジェクトリーリファイニングモジュールを導入することで、リファイニングなしバージョンと比較し、ルートトランスレーション誤差が8.8%低減され、フット速度誤差が14.8%低減された。
- カメラの角速度の使用は不可欠である:これを削除すると、ルートトランスレーション誤差が20.8%増加し、回転誤差が19.8%増加した。これは、カメラ運動と人体運動の混合が顕著に影響を及ぼすことを示している。
- WHAMは3D H3.6Mベンチマークで41.9%の誤差率を達成し、先行手法を著しく上回り、リアルタイム推論速度を維持した。
![Figure 3 : WHAM’s Two-Stage Training Scheme. During pre-taining, we generate synthetic 2D keypoint sequences from AMASS [ 32 ] and train a motion encoder and decoder on the generated data ( top ). We then leverage video datasets with ground truth SMPL parameters, for which there is much less data. W](https://ar5iv.labs.arxiv.org/html/2312.07531/assets/x3.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。