Skip to main content
QUICK REVIEW

[論文レビュー] It's all Relative: Monocular 3D Human Pose Estimation from Weakly Supervised Data

Matteo Ruggero Ronchi, Oisin Mac Aodha|arXiv (Cornell University)|May 17, 2018
Human Pose and Action Recognition被引用数 15
ひとこと要約

この論文では、高価な3次元の真値ではなく、クラウドソーシングによるラベリングで簡単に収集可能な相対的深度ラベルのみを用いる弱教師付き3次元人体ポーズ推定手法を提案する。スパースな相対的深度制約を用いてリフトベースのモデルを訓練することで、完全教師あり手法と同等の性能を達成し、実世界の3次元ポーズ推定に既存の2次元データセットを活用可能にする。

ABSTRACT

We address the problem of 3D human pose estimation from 2D input images using only weakly supervised training data. Despite showing considerable success for 2D pose estimation, the application of supervised machine learning to 3D pose estimation in real world images is currently hampered by the lack of varied training images with corresponding 3D poses. Most existing 3D pose estimation algorithms train on data that has either been collected in carefully controlled studio settings or has been generated synthetically. Instead, we take a different approach, and propose a 3D human pose estimation algorithm that only requires relative estimates of depth at training time. Such training signal, although noisy, can be easily collected from crowd annotators, and is of sufficient quality for enabling successful training and evaluation of 3D pose algorithms. Our results are competitive with fully supervised regression based approaches on the Human3.6M dataset, despite using significantly weaker training data. Our proposed algorithm opens the door to using existing widespread 2D datasets for 3D pose estimation by allowing fine-tuning with noisy relative constraints, resulting in more accurate 3D poses.

研究の動機と目的

  • 実世界の設定において大規模な3次元人体ポーズデータセットが不足している問題に対処し、3次元ポーズ推定モデルの学習と評価を制限する要因を解消すること。
  • 単純でスパースでクラウドラベリング可能な相対的深度ラベルが、3次元ポーズ推定器の学習における完全な3次元教師信号の代替として有効であるかを検討すること。
  • 相対的深度制約による弱教師信号が、標準ベンチマークで完全教師あり手法と同等の性能を達成できることを実証すること。
  • 今後の弱教師付き3次元ポーズ推定研究を促進するため、学習および評価用の相対的関節深度ラベルを含む新しいデータセットを公開すること。

提案手法

  • 本手法は2次元キーポイント検出結果を入力とし、3次元ポーズに変換するリフトベースのアプローチを採用し、学習中に完全な3次元真値を必要としない。
  • 本手法は、2つの関節の間でどちらがカメラに近いかを学習するための、相対的深度制約を強制する新しい損失関数を導入する。
  • 相対的深度の教師信号はクラウドラベリングにより収集され、2つの関節のうちどちらがカメラに近いかをラベラーが指定することで、弱いが効果的な教師信号が得られる。
  • 2次元キーポイントの教師信号と相対的深度制約の両方を用いて、エンドツーエンドでモデルを訓練する。後者はスパースでノイズを含んでも、学習に十分な情報を持つ。
  • 本手法はHuman3.6MおよびLSPデータセットで評価され、追加の相対的深度ラベルを用いたファインチューニングにより汎化性能が向上する。
  • 実験により、ノイズのあるラベルに対してもモデルが頑健であることが示され、限られた教師信号でも強い性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1クラウドソーシングによるラベリングで収集可能な相対的深度ラベルは、3次元人体ポーズ推定モデルの学習に効果的に利用可能か?
  • RQ2相対的深度教師信号を用いて学習した3次元ポーズ推定器の性能は、標準ベンチマークにおける完全教師ありベースラインと比べてどの程度か?
  • RQ3相対的深度による弱教師信号は、学習データにない多様なポーズや視点を持つデータセットにおいて、汎化性能を向上させられるか?
  • RQ43次元真値を一切必要とせず、2次元キーポイント入力と相対的深度制約のみで、競争力のある3次元ポーズ推定性能を達成できるか?

主な発見

  • 提案手法は、相対的深度教師信号のみを用いて、Human3.6Mのプロトコル#2で48.5 mmの平均誤差を達成し、完全教師あり手法と同等の性能を示した。
  • LSPデータセットに追加の相対的深度ラベルを用いたファインチューニングにより、相対的ラベル誤差は24.1%まで低下し、完全教師ありベースラインを上回った。
  • LSPデータセットのみで相対的モデルをスクラッチから訓練した場合、テスト誤差は27.1%にまで低下し、同データセットにおける完全教師ありベースラインを上回った。
  • 特にLSPでのファインチューニング後、訓練データにない非日常的なポーズや視点に対しても、モデルの汎化性能が顕著に向上しており、定性的な結果からもその有効性が示された。
  • 相対的深度ペアにシミュレーテッドノイズを加えても性能に顕著な影響がなく、実世界のラベルノイズに対しても頑健であることが示された。
  • 本手法により、既存の2次元データセットにのみスパースで容易に収集可能な相対的深度ラベルを追加することで、3次元ポーズ推定が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。