Skip to main content
QUICK REVIEW

[論文レビュー] HDNet: Human Depth Estimation for Multi-Person Camera-Space Localization

Jiahao Lin, Gim Hee Lee|arXiv (Cornell University)|Jul 17, 2020
Human Pose and Action Recognition参考文献 30被引用数 6
ひとこと要約

HDNet は、2次元ポーズ推定と深度推定を同時に学習することで、カメラ座標系における絶対的根関節深度を推定するエンドツーエンドのディーブラーニングフレームワークである。ヒートマップ誘導型特徴プーリング、関節間特徴伝搬のためのスケルトンベースのグラフニューラルネットワーク(GNN)、および精度向上のためのソフト・アーグマックスを用いたビン分類タスクとしての深度推定を採用し、Human3.6M および MuPoTS-3D で複数の指標において先行SOTAを上回っている。

ABSTRACT

Current works on multi-person 3D pose estimation mainly focus on the estimation of the 3D joint locations relative to the root joint and ignore the absolute locations of each pose. In this paper, we propose the Human Depth Estimation Network (HDNet), an end-to-end framework for absolute root joint localization in the camera coordinate space. Our HDNet first estimates the 2D human pose with heatmaps of the joints. These estimated heatmaps serve as attention masks for pooling features from image regions corresponding to the target person. A skeleton-based Graph Neural Network (GNN) is utilized to propagate features among joints. We formulate the target depth regression as a bin index estimation problem, which can be transformed with a soft-argmax operation from the classification output of our HDNet. We evaluate our HDNet on the root joint localization and root-relative 3D pose estimation tasks with two benchmark datasets, i.e., Human3.6M and MuPoTS-3D. The experimental results show that we outperform the previous state-of-the-art consistently under multiple evaluation metrics. Our source code is available at: https://github.com/jiahaoLjh/HumanDepth.

研究の動機と目的

  • マルチペルソン 3D ポーズ推定において、通常は根関節相対の関節位置に焦点を当てているが、絶対的 3D ローカライゼーションの欠如に対処すること。
  • 人間のボディープライアーや関節ヒートマップを注視マスクとして用いることで、単眼画像における根関節深度推定の精度を向上させること。
  • 2次元ポーズ推定と絶対的深度回帰を同時に最適化するエンドツーエンドのフレームワークを開発し、ローカライゼーション精度と後続の 3D ポーズ推定精度を向上させること。
  • ボクシングボックスのサイズに依存する従来の手法の限界を克服し、ポーズの変化や検出器の不一致に敏感な問題を解消すること。

提案手法

  • HDNet はまずヒートマップを用いて 2次元人体ポーズを推定し、そのヒートマップを注視マスクとして用いて各関節タイプに特化した画像特徴をプールする。
  • ポーズに依存する特徴は、スケルトンベースのグラフニューラルネットワーク(GNN)に供給され、ボディ関節間で特徴を伝搬・精錬することで深度推定を向上させる。
  • 深度推定は、事前に定義されたビンに深度を離散化することで分類タスクとして定式化され、安定した学習とより良い一般化性を実現する。
  • ネットワークはビン分類出力を連続的な深度予測に変換するためにソフト・アーグマックス操作を用い、収束性と精度を向上させる。
  • マルチスケール特徴ピラミッドネットワーク(FPN)を用いて豊富な特徴を抽出し、特徴の相関バイアスを避けるためにポーズ推定と深度推定のための別々のブランチを設ける。
  • すべてのコンponentを共同最適化するため、2次元ポーズ推定と深度分類の組み合わせ損失を用いてエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ12次元ポーズ推定と深度回帰をエンドツーエンドフレームワークで効果的に統合することで、絶対的 3D ポーズローカライゼーションが向上するか?
  • RQ2関節ヒートマップを特徴プーリングの注視マスクとして用いることで、グローバルプーリングやボックスベース手法と比較して深度推定精度が向上するか?
  • RQ3スケルトンベースの GNN は関節間で特徴を効果的に伝搬・精錬し、深度推定を向上させることができるか?
  • RQ4ソフト・アーグマックスを用いたビン分類タスクとしての深度回帰は、直接回帰よりも単眼深度推定において効果的か?
  • RQ5改善された根関節ローカライゼーションは、後続の根関節相対 3D ポーズ推定タスクの性能向上に寄与するか?

主な発見

  • Human3.6M データセットでは、HDNet は平均相対誤差(MRPE_z)が 69.9 mm に達し、先行SOTAの RootNet よりも 38.2 mm 低い。
  • MuPoTS-3D データセットでは、25 mm 以内の精度(AP₂₅^root)が 39.4% に達し、RootNet の 31.0% よりも 8.4% 向上した。
  • アブレーションスタディにより、GNN コンponentは全結合層と比較して誤差を 3 mm 減少させ、特徴伝搬における有効性が確認された。
  • ヒートマップベースのプーリングを削除すると、MRPE_z が 1.9 mm 増加し、AP₂₅^root が 13.4% 減少するため、選択的特徴集約における重要性が証明された。
  • 直接深度回帰はビン分類より性能が悪く、MRPE_z が 14.2 mm 高くなることから、分類ベースのアプローチの利点が裏付けられた。
  • 改善された根関節ローカライゼーションは、根関節相対 3D ポーズ推定を向上させ、平均 3DPCK_rel を先行SOTAより 1.2% 向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。