Skip to main content
QUICK REVIEW

[論文レビュー] Dynamics-Regulated Kinematic Policy for Egocentric Pose Estimation

Zhengyi Luo, Ryo Hachiuma|arXiv (Cornell University)|Jun 10, 2021
Human Pose and Action Recognition参考文献 48被引用数 38
ひとこと要約

この研究は、運動学と力学をシーン文脈と結合し、単一のヘッドマウントカメラから物理的に妥当な3D自己視点ポーズを推定するためのダイナミクス規制付き訓練を用いて、運動学ポリシーを物理シミュレータ内の学習済み普遍的ヒューマノイドコントローラに整合させる。

ABSTRACT

We propose a method for object-aware 3D egocentric pose estimation that tightly integrates kinematics modeling, dynamics modeling, and scene object information. Unlike prior kinematics or dynamics-based approaches where the two components are used disjointly, we synergize the two approaches via dynamics-regulated training. At each timestep, a kinematic model is used to provide a target pose using video evidence and simulation state. Then, a prelearned dynamics model attempts to mimic the kinematic pose in a physics simulator. By comparing the pose instructed by the kinematic model against the pose generated by the dynamics model, we can use their misalignment to further improve the kinematic model. By factoring in the 6DoF pose of objects (e.g., chairs, boxes) in the scene, we demonstrate for the first time, the ability to estimate physically-plausible 3D human-object interactions using a single wearable camera. We evaluate our egocentric pose estimation method in both controlled laboratory settings and real-world scenarios.

研究の動機と目的

  • 単一の正面向きカメラから、物理的に妥当な3D自分視点の全身ポーズと物体相互作用を推定するという課題を動機づけ、解決する。
  • 大規模MoCapデータから学習され、多様な人間の動作を模倣する汎用的なヒューマノイド物理コントローラを開発する。
  • 運動学、力学、シーン文脈を緊密に統合するダイナミクス規制訓練手法を提案し、頑健な自己視点ポーズ推定を実現する。
  • 物体コンテキストとシーン制約が、絶対的な3Dポーズと相互作用の現実感をどのように向上させるかを示す。
  • 制御されたMoCapラボデータと実世界のシーケンスで評価し、ポーズベースおよび物理ベースの指標が改善されることを示す。

提案手法

  • 大規模MoCapデータから、物理シミュレータ内で多様な人間の動作を模倣するUniversal Humanoid Controller (UHC) を学習する。
  • 動画証拠とシーン文脈に導かれて、フレームごとのターゲットポーズを出力するオブジェクト認識型運動学ポリシーを開発する。
  • 監視学習(運動学的ターゲット)と強化学習(シミュレーションによる物理的妥当性)を組み合わせたダイナミクス規制訓練を導入する。
  • 初期のシーン文脈、オブジェクト状態、および次フレームの観測を統合して、1ステップごとのターゲットを予測する自己回帰的でエージェント中心の運動学ポリシーを用いる。
  • 監視学習のためのポーズベース損失と、動作模倣とダイナミクス整合性を促進する物理ベースの報酬を統合する(UHCを介して)。
  • テスト時には、UHCを低レベルのコントローラとして機能させ、物理シミュレータ内で運動学ポリシーをロールアウトして、物理的に妥当なポーズを生成する。

実験結果

リサーチクエスチョン

  • RQ1運動学、力学、シーン文脈を統合することで、単一の正面向きカメラから物理的に妥当な3D自己視点ポーズと人–物体相互作用を推定できるか。
  • RQ2学習済みのタスクに依存しないヒューマノイド・コントローラは、オブジェクト認識を取り入れた運動学ポリシーに導かれた場合、物理シミュレータ内で広範な動作の頑健な模倣を可能にするか。
  • RQ3ダイナミクス規制訓練は、実世界のドメインシフトへの頑健性を改善し、純粋な運動学法や純粋な力学ベース法と比較して絶対ポーズ追跡を改善するか。
  • RQ46DoFの物体ポーズとシーン文脈を取り入れることで、自己視点のポーズ推定の品質と相互作用のリアリズムにどう影響するか。

主な発見

  • 本手法は、単一のヘッドマウントカメラから物理的に妥当な3D自己視点ポーズと相互作用を推定する。
  • MoCapから学習されたUniversal Humanoid Controllerは、物理シミュレータ内で幅広い動作を模倣できる。
  • ダイナミクス規制訓練は、運動学、力学、シーン文脈を相乗的に統合して頑健性とポーズ精度を向上させる。
  • MoCapデータセットと実世界データの実験は、ポーズベースおよび物理ベースの指標で最先端法より改善を示した。
  • 本手法はシーン内の6DoF物体ポーズを明示的にモデル化し、現実的な人-物体相互作用を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。