Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised 3D Pose Estimation with Geometric Self-Supervision

Ching-Hang Chen, Ambrish Tyagi|arXiv (Cornell University)|Apr 9, 2019
Human Pose and Action Recognition参考文献 57被引用数 19
ひとこと要約

この論文は、3Dデータ、2D-3D対応関係、3D事前知識を一切必要としない、幾何的自己教師付きの非教師付き3次元人体ポーズ推定手法を提案する。リフト、ランダム再投影、再リフトを通じて一貫性を強制することで、Human3.6Mで先行する非教師付き手法よりも30%の性能向上を達成し、5%の3Dデータで微調整した場合、完全教師あり手法と同等の性能を達成する。

ABSTRACT

We present an unsupervised learning approach to recover 3D human pose from 2D skeletal joints extracted from a single image. Our method does not require any multi-view image data, 3D skeletons, correspondences between 2D-3D points, or use previously learned 3D priors during training. A lifting network accepts 2D landmarks as inputs and generates a corresponding 3D skeleton estimate. During training, the recovered 3D skeleton is reprojected on random camera viewpoints to generate new "synthetic" 2D poses. By lifting the synthetic 2D poses back to 3D and re-projecting them in the original camera view, we can define self-consistency loss both in 3D and in 2D. The training can thus be self supervised by exploiting the geometric self-consistency of the lift-reproject-lift process. We show that self-consistency alone is not sufficient to generate realistic skeletons, however adding a 2D pose discriminator enables the lifter to output valid 3D poses. Additionally, to learn from 2D poses "in the wild", we train an unsupervised 2D domain adapter network to allow for an expansion of 2D data. This improves results and demonstrates the usefulness of 2D pose data for unsupervised 3D lifting. Results on Human3.6M dataset for 3D human pose estimation demonstrate that our approach improves upon the previous unsupervised methods by 30% and outperforms many weakly supervised approaches that explicitly use 3D data.

研究の動機と目的

  • 3D監視、3D事前知識、マルチビュー情報なしで2次元関節座標からの3次元人体ポーズ推定を可能にすること。
  • ランダムカメラビュー間での3次元リフトと再投影の幾何的一致性に基づく自己教師付き学習フレームワークの開発。
  • 2次元キーポイント表現の非教師的ドメイン適応により、動画や画像など多様なドメインからの2次元ポーズへの一般化を可能にすること。
  • 幾何的自己教師付き学習と2次元ポーズディスクラミネーターを組み合わせることで、3次元ポーズ予測のロバスト性と現実性を向上させること。
  • 非教師付き3次元リフトが、2次元データのみを用いて弱教師ありや完全教師あり手法と同等の性能を達成できることを示すこと。

提案手法

  • リフトネットワークが深層ニューラルネットワークを用いて2次元関節座標を3次元スケルトンにマッピングする。
  • 3次元スケルトンをランダムなカメラ視点に再投影することで、合成された2次元ポーズを生成し、幾何的自己教師付き学習を実装する。
  • 合成された2次元ポーズを再びリフトして得られる3次元出力を、元のリフトされた3次元スケルトンと比較し、自己一貫性損失を計算する。
  • 実際の2次元ポーズと再投影された合成2次元ポーズを区別できるように2次元ポーズディスクラミネーターを訓練し、3次元出力の現実性を向上させるフィードバックを提供する。
  • 教師なし2次元ドメインアダプターネットワークを訓練し、アノテーションの対応関係なしに異なるデータセット間の2次元キーポイント分布を一致させる。
  • 動画データが利用可能な場合、時間的整合性を活用するための時間的ディスクラミネーターを導入し、性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ13次元監視なしで、幾何的一致性のみを用いて2次元関節座標から正確に3次元人体ポーズを推定できるか?
  • RQ2幾何的自己教師付き学習は、現実的な3次元ポーズを生成するのに十分か、あるいは追加の正則化信号が必要か?
  • RQ3動画や画像など多様なソースからの2次元ポーズデータを、非教師的に効果的に3次元リフトに活用できるか?
  • RQ4動画シーケンスからの時間的整合性を組み込むことで、非教師付き3次元ポーズ推定器の性能にどのような影響を与えるか?
  • RQ53次元アノテーションなしで、トレーニングに使わなかったデータセット(例:MPII や LSP)に対してもモデルが一般化可能か?

主な発見

  • 提案手法は、先行する非教師付き手法と比較して、Human3.6Mデータセットにおいて非教師付き3次元ポーズ推定の最先端性能を30%向上させた。
  • Human3.6Mの3Dデータの5%のみで微調整した場合、平均関節位置誤差(MPJPE)が37mmにまで低下し、完全教師あり手法と同等の性能を達成した。
  • MPII や LSP といった未学習のデータセットに対しても、推論時に3次元アノテーションを一切使用せず、妥当な3次元ポーズを効果的に生成できた。
  • 2次元ポーズディスクラミネーターの追加により、幾何的自己一貫性のみでは不十分な現実性の高い3次元ポーズ生成が顕著に向上した。
  • 時間的ディスクラミネーターによる時間的整合性の統合により、単一フレームでの推論時でもさらに7%の性能向上が達成された。
  • 異なるデータセット(例:Kinetics)からの2次元ポーズを一致させるドメインアダプタの使用により、トレーニングデータの多様性が著しく拡大し、一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。