[論文レビュー] EgoCap: Egocentric Marker-less Motion Capture with Two Fisheye Cameras
EgoCapは、2台のヘッドマウント型魚眼レンズカメラを用いて、屋内・屋外の制約のない環境、混雑したシーンを含め、リアルタイムでマーカーレスな全身モーションキャプチャを実現する。生成的ポーズ推定モデルとConvNetベースのボディパーツ検出器を統合し、没入型バーチャルリアリティへの応用を可能にする。
Marker-based and marker-less optical skeletal motion-capture methods use an outside-in arrangement of cameras placed around a scene, with viewpoints converging on the center. They often create discomfort by possibly needed marker suits, and their recording volume is severely restricted and often constrained to indoor scenes with controlled backgrounds. Alternative suit-based systems use several inertial measurement units or an exoskeleton to capture motion. This makes capturing independent of a confined volume, but requires substantial, often constraining, and hard to set up body instrumentation. We therefore propose a new method for real-time, marker-less and egocentric motion capture which estimates the full-body skeleton pose from a lightweight stereo pair of fisheye cameras that are attached to a helmet or virtual reality headset. It combines the strength of a new generative pose estimation framework for fisheye views with a ConvNet-based body-part detector trained on a large new dataset. Our inside-in method captures full-body motion in general indoor and outdoor scenes, and also crowded scenes with many people in close vicinity. The captured user can freely move around, which enables reconstruction of larger-scale activities and is particularly useful in virtual reality to freely roam and interact, while seeing the fully motion-captured virtual body.
研究の動機と目的
- 制限された記録領域と制御された背景を必要とする従来のアウトサイドイン型モーションキャプチャシステムの限界を解消すること。
- 広範な装着・キャリブレーションを要するボディに装着するセンサーシステム(例:IMU、外骨格)の制約を克服すること。
- 軽量で装着可能なカメラセットアップを用いて、制約のない大規模かつ混雑した環境での全身モーションキャプチャを可能にすること。
- ユーザー自身の身体を3次元で再構築することで、没入型バーチャルリアリティを支援する方法の開発。
- 実世界での耐障害性を高めるために、エゴセントリック魚眼ポーズ推定用の新しいデータセットとトレーニングフレームワークの構築。
提案手法
- ヘッドギアやVRヘッドセットに取り付けた魚眼レンズカメラのステレオペアを用いて、エゴセントリックな視点から全身を捉える。
- レイトレイティング画像形成モデルに基づく生成的ポーズ推定フレームワークを採用し、解析的に微分可能なアライメントおよび可視性モデリングを可能にする。
- 大規模な実際のエゴセントリック魚眼画像のポーズデータセットを自動アノテートして訓練した、ConvNetベースのボディパーツ検出器を統合する。
- シーン背景の構造からモーションを推定することで、局所的ボディポーズとグローバルヘッドギア位置を分離する。
- 魚眼レンズが生じる強いパースペクティブ歪みを活用し、奥行きと接近度のための動きの手がかりを強化することで、トラッキングの耐障害性を向上させる。
- 生成モデルとCNN検出結果を統合してポーズと可視性を同時に最適化することで、自己遮蔽や複雑なポーズに対応する。
実験結果
リサーチクエスチョン
- RQ1軽量でヘッドマウント型のステレオ魚眼レンズセットアップは、制約のない屋内・屋外環境でも全身マーカーレスモーションキャプチャを可能にするか?
- RQ2強い歪みを持つ魚眼ビューにおいて、微分可能な可視性およびアライメントエネルギーを持つ生成的ポーズ推定モデルはどの程度効果的か?
- RQ3合成および実際のエゴセントリック魚眼データでトレーニングされたCNNベースのボディパーツ検出器は、自己遮蔽やごみの多い状況下でもポーズ推定精度をどの程度向上させるか?
- RQ4外部センサを一切使用せずに、シーン背景の構造からモーションを信頼性高く推定できるか?
- RQ5従来のアウトサイドイン型またはIMUベースのシステムと比較して、エゴセントリック魚眼セットアップは、設置の自由度、ユーザーの快適性、動的シーンにおけるトラッキングの耐障害性においてどのように異なるか?
主な発見
- EgoCapは、2台のヘッドマウント型魚眼カメラのみを用いて、リアルタイムでマーカーレスな全身モーションキャプチャを実現し、大規模かつ混雑したシーンでも安定した性能を示した。
- 生成的ポーズモデルとCNNベースの検出器の組み合わせにより、自己遮蔽や複雑なボディコンフィギュレーション下でもトラッキング精度が向上した。
- シーン背景の特徴を用いた構造からモーション推定により、局所的ボディポーズとグローバルモーションを分離し、安定したグローバルポーズ推定を実現した。
- 魚眼レンズの強いパースペクティブ歪みにより、奥行きの手がかりが強化され、カメラに対して前後方向の動きの検出が向上した。
- 商業用アウトサイドインシステムに比べて絶対的な精度は低いが、制約のない実世界でのモーションキャプチャに実用性とスケーラビリティを示した。
- ユーザー自身の視点からリアルタイムで全身バーチャルアバターを再構築できるため、没入型VRアプリケーションを支援し、身体の統合感覚とインタラクションを強化した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。