[論文レビュー] 3D Human Pose Estimation from a Single Image via Distance Matrix Regression
本稿では、2次元から3次元ユークリッド距離行列(EDM)への回帰によって、単一の画像からの新しい3次元人体ポーズ推定手法を提案する。2次元座標への直接回帰ではなく、合成データで訓練された単純な全結合型または全畳み込み型ネットワークを用いることで、2次元検出ノイズや隠蔽に対する耐性を高め、Humaneva-IおよびHuman3.6Mで最先端の性能を達成。LSPデータセットにおける非制約的画像に対しても良好な一般化性能を示す。
This paper addresses the problem of 3D human pose estimation from a single image. We follow a standard two-step pipeline by first detecting the 2D position of the $N$ body joints, and then using these observations to infer 3D pose. For the first step, we use a recent CNN-based detector. For the second step, most existing approaches perform 2$N$-to-3$N$ regression of the Cartesian joint coordinates. We show that more precise pose estimates can be obtained by representing both the 2D and 3D human poses using $N imes N$ distance matrices, and formulating the problem as a 2D-to-3D distance matrix regression. For learning such a regressor we leverage on simple Neural Network architectures, which by construction, enforce positivity and symmetry of the predicted matrices. The approach has also the advantage to naturally handle missing observations and allowing to hypothesize the position of non-observed joints. Quantitative results on Humaneva and Human3.6M datasets demonstrate consistent performance gains over state-of-the-art. Qualitative evaluation on the images in-the-wild of the LSP dataset, using the regressor learned on Human3.6M, reveals very promising generalization results.
研究の動機と目的
- 関節配置からの構造的事前知識を活用することで、単一のRGB画像からの3次元人体ポーズ推定の不適切な性質に対処する。
- ノイズに敏感で構造的不変性を欠く、直接的な2次元から3次元デカルト座標への回帰の限界を克服する。
- 合成データからの学習と、ポーズ幾何を符号化する距離行列の使用により、非制約的で現実世界の画像への一般化を向上させる。
- 距離行列によるペアワイズ関節関係のモデル化により、欠損または隠蔽された身体部位の仮説を可能にする。
- 制御されたノイズと隠蔽を含む合成データで訓練された浅いニューラルネットワークを用いて、高い精度と耐性を実現する。
提案手法
- N個の身体関節を持つ2次元および3次元人体ポーズを、N×Nのユークリッド距離行列(EDM)として表現する。このEDMは、N個の関節間のペアワイズ距離を符号化する。
- 3次元ポーズ推定タスクを、2次元EDMから3次元EDMへの回帰問題として定式化する。入力は2次元EDM、出力は予測された3次元EDMである。
- 全結合型(FConn)および全畳み込み型(FConv)ニューラルネットワークを訓練し、2次元EDMから3次元EDMへのマッピングを実現する。ネットワークの深さは、入力サイズが小さい(N=14関節)ことを考慮して選定する。
- EDMが本質的に対称的かつ半正定値であることから、ネットワーク出力に構造的制約(正定値性、対称性)を構築によって強制する。
- 標準的なEDM埋め込み手法としての多次元スケーリング(MDS)を用いて、予測された3次元EDMから3次元関節座標を再構築する。
- 2次元検出ノイズと関節の隠蔽を含む合成データを用いて訓練データを合成することで、耐性を向上させる。これは、EDMが関節位置にのみ依存することを活用する。
実験結果
リサーチクエスチョン
- RQ12次元および3次元ポーズを距離行列として表現することで、直接的な2次元から3次元座標への回帰と比較して、3次元ポーズ推定の精度が向上するか?
- RQ2距離行列回帰は、2次元検出ノイズおよび関節の部分的隠蔽に対して、性能向上をもたらすか?
- RQ3制御されたラボベースのデータセット(例:Human3.6M)で訓練されたモデルは、非制約的で現実世界の画像(例:LSP)に効果的に一般化できるか?
- RQ4可視関節間の距離のみを用いて、隠蔽されたか観測不能な関節の3次元位置をどの程度正確に仮説できるか?
- RQ5ノイズと隠蔽を含む合成データで訓練された、単純なニューラルネットワークアーキテクチャは、2次元から3次元EDMへの回帰において、どのような性能を示すか?
主な発見
- 提案手法は、Humaneva-IおよびHuman3.6Mベンチマークで最先端の性能を達成し、従来手法よりも3次元ポーズ推定精度が優れている。
- Humaneva-Iデータセットでは、プロトコル#3において平均3次元誤差が104.8 mmにまで低下し、先行手法を顕著に上回る。
- 非制約的画像への一般化性能が良好である:LSPデータセットでは、推定された3次元ポーズの2次元再投影誤差が平均6.76ピクセルにまで低下し、CPM検出のみを用いた場合の9.08ピクセルと比較して顕著に改善した。
- 2次元検出に標準偏差20ピクセルのガウスノイズを追加しても、3次元誤差は徐々に増加し、合理的な範囲内に保たれるため、検出ノイズに対する強い耐性が示された。
- 全畳み込み型ネットワークバージョンは、構造的およびランダムな隠蔽シナリオの両方で、隠蔽された四肢を一貫して仮説することができたが、稀なポーズ(例:「Sit」や「Photo」)ではわずかに性能が低下した。
- LSP画像における結果の視覚的検証から、本手法は、トレーニング時に見られなかった新しい動作や視点に対しても、妥当な3次元ポーズを生成することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。