Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Camera Viewpoint Improves Cross-dataset Generalization for 3D Human Pose Estimation

Zhe Wang, Daeyun Shin|arXiv (Cornell University)|Apr 7, 2020
Human Pose and Action Recognition参考文献 53被引用数 6
ひとこと要約

本稿では、単眼3次元人体ポーズ推定におけるデータセット間一般化性能を向上させるために、身体中心座標系に対するカメラの視点を補助タスクとして予測することを提案する。既存の関節座標のみを用いて3次元ポーズとカメラ視点を同時に予測するモデルを訓練することで、データセット固有のカメラ分布への過学習を軽減し、5つのベンチマークデータセットで最先端の性能を達成した。局所クラスタリングベースラインと比較してMPJPEが3.4 mm改善された。

ABSTRACT

Monocular estimation of 3d human pose has attracted increased attention with the availability of large ground-truth motion capture datasets. However, the diversity of training data available is limited and it is not clear to what extent methods generalize outside the specific datasets they are trained on. In this work we carry out a systematic study of the diversity and biases present in specific datasets and its effect on cross-dataset generalization across a compendium of 5 pose datasets. We specifically focus on systematic differences in the distribution of camera viewpoints relative to a body-centered coordinate frame. Based on this observation, we propose an auxiliary task of predicting the camera viewpoint in addition to pose. We find that models trained to jointly predict viewpoint and pose systematically show significantly improved cross-dataset generalization.

研究の動機と目的

  • 既存の3次元人体ポーズデータセットに内在する系統的バイアス、特に人体に対するカメラ視点分布の偏りを調査すること。
  • データセット固有のバイアスによる3次元ポーズ推定のデータセット間一般化性能の低さという課題に対処すること。
  • 追加のアノテーションを必要とせず、モデルのロバスト性を向上させるために、新たな補助タスク「カメラ視点予測」を提案すること。
  • 視点予測が多様なデータセット間での一般化性能を向上させることを実証すること、同時に個々のデータセットでの性能を維持または向上させること。

提案手法

  • 本手法は、カメラ中心座標系と身体中心座標系の間の相対回転を推定する補助視点予測ブランチを導入する。
  • カメラの視点は、体幹ベクトルに対するカメラ方向のk-meansクラスタリングを用いて、真値の3次元関節座標から導出する。
  • 離散的視点予測には分類ヘッド(クォータニオンベース)、連続的視点推定には回帰ヘッドを用いる。
  • 最終的なポーズ予測はカメラ中心フレームで行われるが、視点予測は交差エントロピー損失と回帰損失の両方で訓練される。
  • PoseNetなどの既存の3次元ポーズモデルに視点ヘッドを追加することで、本手法はオフザシェルフのモデルに対しても適用可能であり、共同最適化が可能になる。
  • 視点ラベルは既存の3次元関節データから直接計算可能であるため、新たなアノテーションは一切不要である。

実験結果

リサーチクエスチョン

  • RQ13次元人体ポーズデータセット間で系統的に異なるカメラ視点分布が、データセット間一般化性能に与える影響は何か?
  • RQ2身体中心座標系に対するカメラ視点を予測することで、特定データセットのバイアスへの過学習が軽減されるか?
  • RQ3視点予測を補助タスクとして追加することで、多様なデータセット間での3次元ポーズ推定性能が向上するか?
  • RQ4視点表現の選択(分類 vs. 回帰)が性能に与える影響は何か?
  • RQ5追加のアノテーションやドメイン適応を必要とせずに、視点予測が一般化性能を向上させられるか?

主な発見

  • 提案手法は、H36M(52.0 mm)、GPA(53.3 mm)、SURREAL(37.1 mm)、3DPW(89.7 mm)、3DHP(90.3 mm)の5つのベンチマークデータセットすべてで最先端のMPJPE性能を達成した。
  • 局所クラスタリングを用いたベースラインと比較して、MPJPEが3.4 mm低減された。
  • k=100でk-meansクラスタリングを適用した場合が最良の性能を示し、複数のk値における最適設定と比較してMPJPE差は6 mm以内であった。
  • クォータニオンベースの分類手法を用いることで、回帰のみの視点予測と比較して誤差が4.3 mm低減された。
  • 標準ポーズ予測ブランチの追加は性能向上に寄与しなかったことから、一般化の観点では視点予測がより効果的であることが示唆された。
  • 本手法は強力なデータセット間一般化性能を達成しており、H36Mで学習したモデルは自データセットで最も優れた性能を示し、視点分布が最も異なる3DHPでもベースラインを顕著に上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。