Skip to main content
QUICK REVIEW

[論文レビュー] Ego-Pose Estimation and Forecasting as Real-Time PD Control

Ye Yuan, Kris Kitani|arXiv (Cornell University)|Jun 7, 2019
Human Pose and Action Recognition参考文献 68被引用数 10
ひとこと要約

本論文は、未分類のエゴセントリック動画とモーションキャプチャデータを用いて、物理学シミュレータ内でのリアルタイム比例微分(PD)制御として3次元エゴポーズ推定と予測を定式化する強化学習ベースの手法を提案する。本手法は、ポーズ推定および長時間予測の両面で最先端の精度と安定性を達成し、リアルタイムデプロイメントに適した30 FPSで動作する。

ABSTRACT

We propose the use of a proportional-derivative (PD) control based policy learned via reinforcement learning (RL) to estimate and forecast 3D human pose from egocentric videos. The method learns directly from unsegmented egocentric videos and motion capture data consisting of various complex human motions (e.g., crouching, hopping, bending, and motion transitions). We propose a video-conditioned recurrent control technique to forecast physically-valid and stable future motions of arbitrary length. We also introduce a value function based fail-safe mechanism which enables our method to run as a single pass algorithm over the video data. Experiments with both controlled and in-the-wild data show that our approach outperforms previous art in both quantitative metrics and visual quality of the motions, and is also robust enough to transfer directly to real-world scenarios. Additionally, our time analysis shows that the combined use of our pose estimation and forecasting can run at 30 FPS, making it suitable for real-time applications.

研究の動機と目的

  • 未分類のエゴセントリック動画から複雑でマルチモーダルな人間の動きを推定・予測する課題に対処すること。
  • 分類済みの動きクリップに依存せずに、物理的に妥当で安定した将来の動きを生成する手法を開発すること。
  • 1回のパスで処理可能なストリーミング対応アーキテクチャを用いて、ポーズ推定および予測の両方をリアルタイムで実行できること。
  • 推論中にドメインシフトや物理シミュレータ内での転倒によって生じる制御ベース手法の不安定性を克服すること。
  • 未分類でマルチモーダルな人間の動きデータに特化した、新しい報酬関数と価値ベースのフェイルセーフメカニズムを設計すること。

提案手法

  • 人間型エージェントを深層強化学習ポリシーで制御するマーカフ決定過程(MDP)として、エゴポーズ推定と予測を定式化する。
  • PDコントローラーの目標関節位置をアクション空間として用いることで、物理学シミュレータ内での安定的かつダイナミックな動き制御を実現する。
  • 視覚的文脈から動きフェーズを符号化するため、ポーズ推定にはビデオ条件付きの再帰的ポリシー(双方向LSTM)を、予測には単方向LSTMを採用する。
  • 未分類でマルチモーダルな動きデータに特化した新しい報酬関数を導入し、近い将来の予測精度を優先するために時間的に減衰する成分を含む。
  • 価値関数に基づくフェイルセーフメカニズムを実装し、推論中に人間型エージェントの転倒を予測・防止することで、安定した1回パス動作を可能にする。
  • オプティカルフローとエゴセントリック動画からのCNN特徴量を視覚入力として用い、標準ハードウェア上で30 FPSで推論を実行する。

実験結果

リサーチクエスチョン

  • RQ1PD制御ベースのポリシーが深層強化学習によって学習された場合、未分類のエゴセントリック動画から3次元人間ポーズを正確に推定・予測できるか?
  • RQ2誤差蓄積やキネマティックドリフトを回避しながら、物理的に妥当で安定した長時間予測の将来の動きを生成するにはどうすればよいか?
  • RQ3価値関数推定に基づくフェイルセーフメカニズムは、テスト時微調整なしに、リアルタイム推論中に物理シミュレータ内での転倒を防止できるか?
  • RQ4本手法は、制御環境および現実世界の状況の両方で、複雑な人間の動き(例:しゃがみ込み、飛び跳ねり、動きの遷移など)に対してどの程度性能を発揮するか?
  • RQ5本手法は、再トレーニングなしに被験者間で一般化され、直接現実世界のシナリオに適用可能か、その範囲はどの程度か?

主な発見

  • 提案手法は、ポーズ誤差、速度誤差、リセット回数といった定量的指標において、先行手法を上回る最先端の性能を達成した。
  • 被験者間評価では、1000件のテストシーケンスでたった4回のリセットにとどまり、未観測の被験者への一般化能力が強く示された。
  • エゴポーズ予測において、1秒予測時でポーズ誤差1.179、3秒予測時で1.339を達成し、ERD や acLSTM といったベースラインを顕著に上回った。
  • 主流のCPUとGTX 1080Tiを用いて30 FPSで動作し、双方向ポーズ推定の遅延は1/3秒にとどまるため、リアルタイム推論が可能である。
  • 定性的な結果から、推定および予測された動きが視覚的に正確で、地面真値と同期しており、しゃがみ込みから歩行への自然な遷移なども適切に再現された。
  • アブレーションスタディの結果、提案された報酬関数とフェイルセーフメカニズムが性能に不可欠であることが確認され、それらを除去するとポリシーが不安定化し、加速度やジターリングが増加した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。