Skip to main content
QUICK REVIEW

[論文レビュー] Kinematics-Guided Reinforcement Learning for Object-Aware 3D Ego-Pose Estimation

Zhengyi Luo, Ryo Hachiuma|arXiv (Cornell University)|Nov 10, 2020
Human Pose and Action Recognition参考文献 25被引用数 4
ひとこと要約

本論文は、エゴセントリック動画からの3次元エゴポーズ推定のためのキネマティクスガイドド強化学習フレームワークを提案する。キネマティクスポーズ推定器と物理ベースのダイナミクスモデルを、残留行動空間に統合することで、物理的に妥当な人間-物体インタラクションを生成する。本手法は、ベースラインと比較して、ルートおよびジョイント位置推定で31–48%低い誤差を達成し、特にドリフト補正とワイルドな設定への一般化性能で優れた結果を示した。

ABSTRACT

We propose a method for incorporating object interaction and human body dynamics into the task of 3D ego-pose estimation using a head-mounted camera. We use a kinematics model of the human body to represent the entire range of human motion, and a dynamics model of the body to interact with objects inside a physics simulator. By bringing together object modeling, kinematics modeling, and dynamics modeling in a reinforcement learning (RL) framework, we enable object-aware 3D ego-pose estimation. We devise several representational innovations through the design of the state and action space to incorporate 3D scene context and improve pose estimation quality. We also construct a fine-tuning step to correct the drift and refine the estimated human-object interaction. This is the first work to estimate a physically valid 3D full-body interaction sequence with objects (e.g., chairs, boxes, obstacles) from egocentric videos. Experiments with both controlled and in-the-wild settings show that our method can successfully extract an object-conditioned 3D ego-pose sequence that is consistent with the laws of physics.

研究の動機と目的

  • 身体が頻繁に遮蔽される1人称カメラからの1枚の視覚のみで、3次元全身の人体運動および人間-物体インタラクションを推定する課題に対処すること。
  • 純粋なキネマティクス的またはダイナミクスベースの手法の限界を克服するため、正確なキネマティクス的ポーズ推定と物理的に整合するダイナミクスの精錬を組み合わせること。
  • 3次元シーンの文脈、特に物体のポーズを強化学習の状態表現に組み込むことで、インタラクション予測の精度を向上させること。
  • 実際のエゴセントリック動画からの単眼視覚慣性オドメトリ(VIO)に一致するように、ファインチューニング段階を用いて長時間のインタラクションにおけるシミュレーションドリフトを是正すること。
  • 真の3次元ポーズが入手不可な実世界のワイルドな設定において、一般化性能を示すこと。

提案手法

  • 事前学習済みのキネマティクスポーズ推定器を用いて、強化学習ポリシーが絶対的なジョイントターゲットではなく、残留関節角を予測できるように、初期のポーズ推定値を提供する。
  • 強化学習ポリシーのための新しいアクション空間を設計し、キネマティクスモデルの出力に対する補正を出力することで、より安定的かつ正確なポリシー学習を可能にする。
  • 6自由度(6-DoF)の物体ポーズを強化学習エージェントの状態入力として統合し、ポリシーが物体に意識的かつ文脈に即したシーンインタラクションを認識できるようにする。
  • 人間型アバターの運動が関節トルクによって制御されるシミュレータ内で、物理ベースのダイナミクスモデルを学習させ、物理的に妥当なインタラクション(例:押す、座る)を保証する。
  • VIOから得られるカメラの運動を用いたファインチューニング段階を適用し、シミュレーション内のグローバルなルート軌道ドリフトを是正し、シミュレートされた運動を現実世界のカメラ移動と一致させる。
  • ファインチューニング段階で、頭部の位置・姿勢・速度、キネマティクス正則化、アクションの滑らかさを含む、複数のコンponentを備えた報酬関数を設計し、学習の安定化と現実性の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1純粋なキネマティクス的またはダイナミクスベースの手法と比較して、ハイブリッドなキネマティクスガイドド強化学習フレームワークは、エゴセントリック動画からの3次元エゴポーズ推定の精度と物理的妥当性を向上させることができるか?
  • RQ2強化学習の状態空間に3次元物体ポーズ情報を組み込むことで、人間-物体インタラクション推定の質と現実性はどのように向上するか?
  • RQ3VIOデータを用いたファインチューニングステップは、シミュレーションドリフトをどの程度是正でき、実世界のエゴセントリック動画への一般化性能を向上させられるか?
  • RQ4頭部追跡、正則化などの異なる報酬コンponentが、最終的なポーズ推定性能および運動の滑らかさに与える影響は何か?
  • RQ5提案手法は、真の3次元ポーズが入手不可なドメインシフトが顕著なワイルドな設定において、一般化可能か?

主な発見

  • 提案された残留アクション表現により、絶対的PDターゲットを直接予測するベースライン手法と比較して、ルート平均二乗誤差(RMSE)が31%低減された。
  • アブレーションスタディの結果、頭部、キネマティクス、アクション正則化を含む完全な報酬設計を用いたファインチューニング段階が、最小の誤差を達成した:ルート位置で0.322 RMSE、ジョイント位置で0.788、速度で5.063。
  • ワイルドな設定評価では、ドリフトを伴う行動(例:押す、障害物を避ける)において、ベースラインを大きく上回り、特にルート誤差が次善の手法と比較して34%低減された。
  • ファインチューニング済みポリシーは、椅子に座る、ボックスを押すといった複雑なインタラクションの信頼性あるシミュレーションを可能にした。
  • 加速度および速度指標で測定したところ、本手法はベースライン手法と比較して、2.0倍も滑らかなポーズシーケンスを生成した。
  • 強力な性能を発揮したが、初期ポーズレジレータの出力が不良なワイルドデータでは失敗事例が発生し、自然でない運動が生じ、ファインチューニング段階でも是正が困難だった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。