Skip to main content
QUICK REVIEW

[論文レビュー] Ray3D: ray-based 3D human pose estimation for monocular absolute 3D localization

Yu Zhan, Fenghai Li|arXiv (Cornell University)|Mar 22, 2022
Human Pose and Action Recognition被引用数 7
ひとこと要約

Ray3Dは、カメラ内部パラメータを分離するため、2次元キーポイント検出を3次元正規化された光線に変換する、画期的な単眼3次元人体ポーズ推定手法を提案する。同時に、学習された埋め込みを用いてカメラ外部パラメータ(例:高さ、ピッチ)を明示的にモデル化する。この設計により、カメラ内部および外部パラメータの変化に対して最先端の一般化性能を達成し、3DHPで307.4 mmのMRPEを達成し、ベンチマーク全体でSOTA手法を上回る性能を発揮する。

ABSTRACT

In this paper, we propose a novel monocular ray-based 3D (Ray3D) absolute human pose estimation with calibrated camera. Accurate and generalizable absolute 3D human pose estimation from monocular 2D pose input is an ill-posed problem. To address this challenge, we convert the input from pixel space to 3D normalized rays. This conversion makes our approach robust to camera intrinsic parameter changes. To deal with the in-the-wild camera extrinsic parameter variations, Ray3D explicitly takes the camera extrinsic parameters as an input and jointly models the distribution between the 3D pose rays and camera extrinsic parameters. This novel network design is the key to the outstanding generalizability of Ray3D approach. To have a comprehensive understanding of how the camera intrinsic and extrinsic parameter variations affect the accuracy of absolute 3D key-point localization, we conduct in-depth systematic experiments on three single person 3D benchmarks as well as one synthetic benchmark. These experiments demonstrate that our method significantly outperforms existing state-of-the-art models. Our code and the synthetic dataset are available at https://github.com/YxZhxn/Ray3D .

研究の動機と目的

  • スケール、奥行き、カメラパラメータの曖昧さに起因する、単眼絶対3次元人体ポーズ推定の不適切な性質に対処すること。
  • 実世界の状況下で、焦点距離や主点といったカメラ内部パラメータ、およびピッチ、高さ、ヨーといったカメラ外部パラメータの変化に対する一般化性能を向上させること。
  • パrameterの変化に耐性がなく、視点変化に対して頑健でない既存のリフト型および画像ベース手法の限界を克服すること。
  • ネットワークにキャリブレート済みのカメラ外部パラメータを明示的に組み込むことで、メトリック空間における正確な絶対3次元位置特定を可能にすること。
  • スケール、カメラ姿勢、奥行きの変化を制御した条件下で、合成および実世界のベンチマークを体系的に評価し、頑健性を検証すること。

提案手法

  • カメラ依存のない空間において2次元キーポイント座標を3次元正規化光線に変換し、モデルのカメラ内部パラメータからの分離を実現する。
  • 時間的畳み込みを適用して連続フレーム間の3次元光線を統合し、遮蔽に対する耐性を高め、ポーズ推定精度を向上させる。
  • カメラ高さとピッチを入力として受け取り、外部パラメータの分布をモデル化するMLPベースのカメラ埋め込みモジュールを導入する。
  • 時間的に統合された光線特徴とカメラ埋め込みを連結し、ワールド座標系における正確な3次元キーポイント回帰を支援する。
  • 正規化による内部パラメータの分離を実施し、焦点距離および主点の変化に対しても安定した性能を確保する。
  • 焦点距離や主点の変化を制御した独自の合成データセットに加え、実データベンチマーク(H36M、3DHP、MPI-INF-3DWP)を用いて訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ12次元キーポイントを3次元正規化光線に変換することで、焦点距離や主点といったカメラ内部パラメータの変化に対する頑健性がどのように向上するか?
  • RQ2カメラ外部パラメータ(例:高さやピッチ)を明示的にモデル化することで、多様なカメラ姿勢間での一般化性能はどの程度向上するか?
  • RQ3ボディスケールやカメラと被験者間の距離の極端な変化下で、SOTAベースラインと比較して本手法はどのように性能を発揮するか?
  • RQ4光線の時間的統合は、遮蔽やノイズ下での精度および安定性向上にどの程度寄与するか?
  • RQ5内部パラメータの分離とカメラ埋め込みは、個別および併用した場合に、クロスデータセット一般化性能にそれぞれどのように寄与するか?

主な発見

  • Ray3DはH36Mで学習した上で3DHPデータセットで307.4 mmのMRPEを達成し、RIEベースライン(1079.2 mm)および他のSOTA手法を上回る。
  • 焦点距離や主点といったすべてのテストされたカメラ内部パラメータの変化に対して安定した性能を維持し、最小限の性能低下を示す。
  • カメラピッチ角の変化下でも、-30°から+30°の範囲で一貫した高精度を達成し、ベースラインを著しく上回る。
  • カメラの並進(被験者からの距離)の変化下でも、5メートルの距離であっても誤差が800 mm未満に保たれる一方、ベースラインは急激に性能を低下させる。
  • ボディスケールの変化(0.6×から1.1×)下では、Ray3DのMRPEは800 mmに上昇するが、PoseFormer や RIE と比較して依然として顕著に優れている(最大4メートルの誤差を示すベースラインと比較)。
  • アブレーションスタディにより、内部パラメータの分離、カメラ正規化、カメラ埋め込みがそれぞれ顕著な寄与を示し、フルモデルが最も優れたクロスデータセット一般化性能を達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。