[論文レビュー] AvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion Sensing
AvatarPoser は、頭部およびハンドコントローラーの動きデータのみを用いて世界座標系における全身3次元ボーンポーズを推定する、新しいトランスフォーマー基盤の手法である。これにより、追加のセンサーや仙骨トラッキングの必要がなくなる。AvatarPoser は AMASS で最先端の精度を達成し、グローバルモーションとローカル関節特徴を分離することで、逆運動学を用いた予測の最適化により、リアルタイムで現実的なアバターのアニメーションを実現する。
Today's Mixed Reality head-mounted displays track the user's head pose in world space as well as the user's hands for interaction in both Augmented Reality and Virtual Reality scenarios. While this is adequate to support user input, it unfortunately limits users' virtual representations to just their upper bodies. Current systems thus resort to floating avatars, whose limitation is particularly evident in collaborative settings. To estimate full-body poses from the sparse input sources, prior work has incorporated additional trackers and sensors at the pelvis or lower body, which increases setup complexity and limits practical application in mobile settings. In this paper, we present AvatarPoser, the first learning-based method that predicts full-body poses in world coordinates using only motion input from the user's head and hands. Our method builds on a Transformer encoder to extract deep features from the input signals and decouples global motion from the learned local joint orientations to guide pose estimation. To obtain accurate full-body motions that resemble motion capture animations, we refine the arm joints' positions using an optimization routine with inverse kinematics to match the original tracking input. In our evaluation, AvatarPoser achieved new state-of-the-art results in evaluations on large motion capture datasets (AMASS). At the same time, our method's inference speed supports real-time operation, providing a practical interface to support holistic avatar control and representation for Metaverse applications.
研究の動機と目的
- 現在のミックスドリアリティ(MR)システムにおける全身表現の欠如が、没入感と身体的統合感を制限しているという問題に対処する。
- 頭部およびハンドの動き入力のみから完全な人間のポーズを推定するという、極めて不定な問題に取り組む。
- 追加のセンサー(例:仙骨トラッカー、慣性計測ユニット)への依存を排除することで、モバイルおよび一般消費者向けMR環境での実用的導入を可能にする。
- ディープラーニングとモデルベース最適化を組み合わせることで、アニメーションアバターのリアリズムを向上させ、アーチファクトを低減する。
- 標準のHMDおよびコントローラー入力のみを用いて、メタバースにおける共同作業やテレプレゼンスアプリケーションのための包括的アバター制御を実現する。
提案手法
- スパースな動き入力(頭部およびハンド/コントローラーのポーズ)から深く文脈的な特徴を抽出するために、トランスフォーマーのエンコーダーを用いる。
- グローバルモーション(並進および回転)と学習されたローカル関節回転を分離することで、より高いロバスト性と一般化性能を実現する。
- 頭部入力から全身関節位置を推定するため、学習可能な頭部〜仙骨間のキネマティックチェーンを用いて全身関節位置を予測する。
- 予測後に逆運動学(IK)最適化ステップを適用し、キネマティックチェーン内の誤差蓄積を低減する。
- 入力特徴から直接グローバル回転を学習する「Stabilizerモジュール」を導入し、頭部のみの回転推定に比べて安定性を向上させる。
- トレーニング中にフォワードキネマティクス(FK)モジュールを用いて、スケルトン変換後の関節位置を監視することで、物理的に妥当な構成を保証する。
実験結果
リサーチクエスチョン
- RQ1頭部およびハンドの動きデータのみを用いて、仙骨や体に装着するセンサーを一切用いずに、正確に全身3次元ボーンポーズ推定が可能か?
- RQ2学習ベースの手法が、グローバルモーションとローカル関節特徴を効果的に分離することで、ポーズ推定のロバスト性を向上させられるか?
- RQ3ニューラルネットワークの予測と逆運動学を組み合わせることで、全身アバターのアニメーションのリアリズムと正確性がどの程度向上するか?
- RQ4大規模なモーションキャプチャデータ上で、最先端の手法と比較して、ポーズの正確性と推論速度の両面で本手法はどのように性能を示すか?
- RQ5本手法は、多様な動きの種類に一般化可能であり、リアルタイムで実用的なMR環境でも性能を維持できるか?
主な発見
- AvatarPoser は AMASS ベンチマークで最先端の性能を達成し、従来手法を上回る全身ポーズ推定の正確性を実現した。
- Stabilizerモジュールによる学習されたグローバル回転の活用により、頭部のみの回転推定に比べて安定性が向上し、MPJPE(平均関節位置誤差)が低減した。
- Stabilizerモジュールを削除するとMPJPEが上昇し、頭部回転ノイズの処理とグローバルポーズの一貫性向上においてその重要性が確認された。
- ネットワーク内で仙骨位置を直接回帰すると、キネマティックチェーンによる計算に比べて性能が劣り、グローバル並進のためのフォワードキネマティクスの有効性が裏付けられた。
- IKの最適化ステップにより、直接ネットワーク出力に比べて手の位置誤差が約41%低減され、誤差蓄積の是正においてその有効性が実証された。
- AvatarPoser は、NVIDIA 3090 GPU 上で平均フレームタイムが10ms未満のリアルタイム推論を達成しており、実用的なVR/ARへの展開に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。