Skip to main content
QUICK REVIEW

[論文レビュー] HMOR: Hierarchical Multi-Person Ordinal Relations for Monocular Multi-Person 3D Pose Estimation

Jiefeng Li, Can Wang|arXiv (Cornell University)|Aug 1, 2020
Human Pose and Action Recognition参考文献 74被引用数 7
ひとこと要約

本稿では、人物、身体部位、関節間の奥行きおよび角度関係を階層的に符号化する新しい教師付き手法であるHMOR(階層的マルチピアソン順序関係)を提案する。この手法により、単眼マルチピアソン3次元ポーズ推定におけるグローバルな一貫性が向上する。統合されたエンドツーエンドのトップダウンモデルは、粗いから細かい奥行き精錬戦略を用いて、人物検出、奥行き推定、3次元ポーズ推定を同時に実行し、MuPoTS-3DおよびCMU Panopticデータセットで最先端の性能を達成しながら、計算量とパラメータ数を低減した。

ABSTRACT

Remarkable progress has been made in 3D human pose estimation from a monocular RGB camera. However, only a few studies explored 3D multi-person cases. In this paper, we attempt to address the lack of a global perspective of the top-down approaches by introducing a novel form of supervision - Hierarchical Multi-person Ordinal Relations (HMOR). The HMOR encodes interaction information as the ordinal relations of depths and angles hierarchically, which captures the body-part and joint level semantic and maintains global consistency at the same time. In our approach, an integrated top-down model is designed to leverage these ordinal relations in the learning process. The integrated model estimates human bounding boxes, human depths, and root-relative 3D poses simultaneously, with a coarse-to-fine architecture to improve the accuracy of depth estimation. The proposed method significantly outperforms state-of-the-art methods on publicly available multi-person 3D pose datasets. In addition to superior performance, our method costs lower computation complexity and fewer model parameters.

研究の動機と目的

  • トップダウン型の単眼マルチピアソン3次元ポーズ推定手法におけるグローバルシーン理解の欠如を解消すること。
  • 複数の人物が相互作用する複雑でごみだらけのシーンにおける奥行きの曖昧さと隠蔽の課題を軽減すること。
  • 人物、身体部位、関節間の階層的順序関係を組み込むことで、絶対的3次元ポーズ推定の精度を向上させること。
  • 人物検出、奥行き推定、3次元ポーズ回帰を統合的に同時に実行できるエンドツーエンドで学習可能なモデルを開発すること。
  • 従来の手法と比較して、モデルの複雑さと計算コストを低減しながら優れた性能を達成すること。

提案手法

  • 人物インスタンス、身体部位、関節の3段階のレベルで奥行きおよび角度関係をモデル化する階層的マルチピアソン順序関係(HMOR)を導入する。
  • 階層的レベル間で相対的奥行きおよび角度制約として順序付き教師信号を符号化し、予測された3次元ポーズのグローバルな一貫性を強制する。
  • 人物検出、3次元ポーズ推定、人物の奥行き推定を同時にエンドツーエンドで実行する統合されたトップダウンモデルを提案する。
  • 粗いから細かい奥行き推定アーキテクチャを採用:まずグローバルな奥行きマップを生成し、その後で個々の人物の奥行きを残差補正により精錬する。
  • 2次元ポーズアノテーションと互換性のある2次元-3次元混合学習戦略を活用し、効率的かつ効果的な事前学習を可能にする。
  • HMORの教師信号と標準的な3次元ポーズおよび奥行き回帰損失を組み合わせた新しい損失関数を適用し、共同最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1人物、身体部位、関節間の階層的順序関係は、単眼マルチピアソン3次元ポーズ推定におけるグローバルな一貫性を向上させ得るか?
  • RQ2絶対的3次元ポーズの直接回帰と比較して、HMORの教師信号は精度と頑健性においてどのように優れているか?
  • RQ3粗いから細かい奥行き推定戦略は、1枚のRGB画像からの絶対的3次元ポーズ推定の精度をどの程度向上させるか?
  • RQ4統合されたエンドツーエンドモデルは、計算コストを低減しつつ、人物検出、奥行き推定、3次元ポーズ推定を同時に最適化できるか?
  • RQ52次元と3次元のアノテーションを混合して学習した場合、本手法の有効性は何か?また、実世界のシナリオへの一般化性能はどの程度か?

主な発見

  • MuPoTS-3Dデータセットにおいて、本手法は最先端手法と比較して12.3 PCK absの向上を達成した。
  • CMU Panopticデータセットでは、先行研究と比較してMPJPEが20.5 mm改善され、優れた絶対的ポーズ推定精度を示した。
  • Moonら[39](マルチピアソン3次元ポーズ推定の唯一のオープンソースベースライン)と比較して、モデルパラメータを73%削減し、GFLOPsを41%削減した。
  • HMORの教師信号は、直接的な絶対的3次元ポーズ回帰と比較して7.4 mmのMPJPE改善をもたらし、インスタンスレベルの関係が絶対的ポーズ精度向上に最も寄与した。
  • 粗いから細かい奥行き精錬戦略により、直接的な奥行き出力と比較してMPJPEが15.1 mm改善され、正確な奥行き推定に不可欠であることが実証された。
  • 学習中に追加の視点方向をサンプリングすることで、MPJPEが0.6 mm改善され、複雑なシーンへの一般化性能が向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。