Skip to main content
QUICK REVIEW

[論文レビュー] Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision

Dushyant Mehta, Helge Rhodin|arXiv (Cornell University)|Nov 29, 2016
Human Pose and Action Recognition参考文献 74被引用数 16
ひとこと要約

この論文は、2次元ポーズデータセットからの転移学習を活用し、マーカーレスモーションキャプチャシステムで撮影された新しい屋外3次元ポーズデータセット、MPI-INF-3DHPを導入することで、単眼3次元人体ポーズ推定のためのCNNベースの手法を提案する。改善されたCNNの監視、ドメイン適応、データ拡張を組み合わせることで、ベンチマーク上で最先端の性能を達成し、制約のない現実世界のシーンへの一般化性能を顕著に向上させる。

ABSTRACT

We propose a CNN-based approach for 3D human body pose estimation from single RGB images that addresses the issue of limited generalizability of models trained solely on the starkly limited publicly available 3D pose data. Using only the existing 3D pose data and 2D pose data, we show state-of-the-art performance on established benchmarks through transfer of learned features, while also generalizing to in-the-wild scenes. We further introduce a new training set for human body pose estimation from monocular images of real humans that has the ground truth captured with a multi-camera marker-less motion capture system. It complements existing corpora with greater diversity in pose, human appearance, clothing, occlusion, and viewpoints, and enables an increased scope of augmentation. We also contribute a new benchmark that covers outdoor and indoor scenes, and demonstrate that our 3D pose dataset shows better in-the-wild performance than existing annotated data, which is further improved in conjunction with transfer learning from 2D pose data. All in all, we argue that the use of transfer learning of representations in tandem with algorithmic and data contributions is crucial for general 3D body pose estimation.

研究の動機と目的

  • 限られた制御された3次元ポーズデータセットにのみトレーニングされた3次元ポーズ推定モデルの一般化能力の低さに対処する。
  • ポーズの変化、隠蔽、多様な外観が既存の手法に挑戦する制約のない屋外環境での性能を向上させる。
  • 現実世界のシーンにおける大規模で多様かつ現実的な3次元ポーズアノテーションの不足を補うために、マーカーレスマルチカメラシステムで撮影された新しいデータセットを導入する。
  • 2次元ポーズ推定特徴からの転移学習が、現実世界の設定において3次元ポーズ推定の精度と頑健性を顕著に向上させることを示す。
  • 追加の3次元アノテーションを必要とせずに、アーキテクチャの改善、データ拡張、マルチモーダル監視を組み合わせた手法を開発し、モデルの一般化能力を向上させる。

提案手法

  • 2次元ポーズ推定ネットワークで事前学習された特徴を初期化として用い、ドメイン適応を用いてドメイン間の特徴を一致させる。
  • 3次元関節位置、ルートオリエンテーション、パーツラベルの予測ヘッドを用いて、複数の層(res4b5 と res4b20)で中間監視を実装する。
  • 最終畳み込み層(res5a)で2次元ヒートマップとパーツラベルマップの補助監視を実装し、特徴学習を向上させる。
  • Human3.6m と MPI-INF-3DHP データセットを統合するマルチモーダル統合戦略を導入し、ジョイントトレーニングのための個別の学習率スケーリングと損失重みスケジューリングを実装する。
  • 勾配反転を用いたドメイン適応モジュールを導入し、屋外2次元データ(MPII, LSP)の特徴を3次元ポーズネットワークと一致させ、ドメインシフトに対する頑健性を向上させる。
  • 背景、いす、テクスチャの変化を含む広範なデータ拡張を実施し、MPI-INF-3DHP データセットにおけるフォアグラウンドとバックグラウンドの多様性を向上させる。

実験結果

リサーチクエスチョン

  • RQ12次元ポーズ推定ネットワークからの転移学習は、制約のない屋外シーンにおける3次元ポーズ推定の一般化能力を向上させるか?
  • RQ2提案されたデータ拡張およびマルチモーダルトレーニング戦略は、現実世界のシーケンスにおけるモデルの頑健性と性能にどのように影響するか?
  • RQ3マーカーレスシステムで撮影された新しい屋外3次元ポーズデータセットは、既存のデータセットと比較して、どの程度モデルの一般化能力を向上させるか?
  • RQ4CNNアーキテクチャにおける中間監視および補助タスクは、3次元ポーズ推定の精度と特徴学習を向上させるか?
  • RQ5アーキテクチャの改善、データの多様性、および転移学習の組み合わせは、単なる初期化やドメイン適応のみに比べて、どのように優れているか?

主な発見

  • 転移学習を用いた本手法は、MPI-INF-3DHP テストセットで64.7 3DPCKを達成し、ドメイン適応のみを用いた場合(41.4 3DPCK)と比べ顕著に優れている。
  • 新規に導入されたMPI-INF-3DHPデータセットは、既存のベンチマークで最先端の性能を達成し、既存のデータセットと比較して屋外シーンへの一般化性能が優れていることを示している。
  • 適切な微調整を伴う2次元ポーズネットワークからの転移学習は、単純な重み初期化やドメイン適応ベースのアプローチよりも高い精度と一般化能力を実現する。
  • マルチモーダルトレーニング(Human3.6m + MPI-INF-3DHP)と改善されたデータ拡張の組み合わせにより、モデルの頑健性と性能が顕著に向上している。
  • 本手法は制御されたベンチマークで最先端の結果を達成するとともに、同時に屋外シーケンスでも優れた性能を示しており、一般化能力の妥当性を裏付けている。
  • 中間監視と補助タスクの使用は特徴学習を向上させ、3次元関節位置予測の高精度に寄与している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。