Skip to main content
QUICK REVIEW

[論文レビュー] Weakly-Supervised 3D Pose Estimation from a Single Image using Multi-View Consistency

Guillaume Rochette, Chris Russell|arXiv (Cornell University)|Sep 13, 2019
Human Pose and Action Recognition参考文献 27被引用数 8
ひとこと要約

本稿では、マルチビュー整合性をデータ駆動型正則化子として用いる弱教師付き3次元人体ポーズ推定手法を提案する。マルチビュー幾何学に基づく再投影損失をネットワークの訓練損失に統合することで、ドリフトを解消し、強い教師付き手法とほとんど区別できない性能を達成し、トレーニング中に3次元真値を一切使用せずにパノプティックデータセットで最先端の精度に到達する。

ABSTRACT

We present a novel data-driven regularizer for weakly-supervised learning of 3D human pose estimation that eliminates the drift problem that affects existing approaches. We do this by moving the stereo reconstruction problem into the loss of the network itself. This avoids the need to reconstruct 3D data prior to training and unlike previous semi-supervised approaches, avoids the need for a warm-up period of supervised training. The conceptual and implementational simplicity of our approach is fundamental to its appeal. Not only is it straightforward to augment many weakly-supervised approaches with our additional re-projection based loss, but it is obvious how it shapes reconstructions and prevents drift. As such we believe it will be a valuable tool for any researcher working in weakly-supervised 3D reconstruction. Evaluating on Panoptic, the largest multi-camera and markerless dataset available, we obtain an accuracy that is essentially indistinguishable from a strongly-supervised approach making full use of 3D groundtruth in training.

研究の動機と目的

  • 3次元アノテーションの高コストにより、大規模な屋外環境における3次元人体ポーズデータセットが不足している問題に対処すること。
  • 弱教師付き3次元ポーズ推定で一般的に見られるドリフト問題を解消し、モデルの収束性と精度を低下させることを防ぐこと。
  • 3次元真値や事前学習のための教師付きウォームアップフェーズを必要とせず、制約のないマルチカメラデータで学習可能とすること。
  • 弱教師付き3次元ポーズ学習における再構成安定性と精度を向上させる、シンプルで汎用性の高い正則化子を開発すること。
  • 2次元キーポイント検出結果とカメラキャリブレーションのみを用いて、弱教師付きモデルが強い教師付きモデルと同等の性能を達成できることを示すこと。

提案手法

  • 既知のカメラパラメータを用いて予測された3次元ポーズを2次元画像空間に再投影することで、複数のビュー間の一貫性を強制する再投影損失を導入する。
  • 予測された2次元投影とOpenPoseからの真値2次元キーポイント検出結果との差をHuber損失(Smooth L1)で計算する。
  • マルチビュー整合性損失をネットワークの訓練目的に直接統合し、別個の3次元再構成や事前学習の必要性を回避する。
  • 検証誤差に基づく早期停止を適用し、パノプティックデータセット上で1関節あたりの平均3次元誤差(mm単位)を評価する。
  • 3次元真値を一切使用せず、2次元の監視とカメラキャリブレーションのみを用いて、3次元ポーズ回帰ネットワークをエンドツーエンドで学習する。
  • マルチビューステレオの幾何的制約を活用し、3次元ポーズ予測のドリフトを暗黙的に正則化する。

実験結果

リサーチクエスチョン

  • RQ1マルチビュー整合性は、ドリフトを防ぐ弱教師付き3次元ポーズ推定における効果的な正則化子として機能するか?
  • RQ23次元真値を一切使用せずに、弱教師付きモデルが強い教師付きモデルと同等の性能をどの程度達成できるか?
  • RQ3訓練目的に再投影損失を統合することで、3次元監視を伴うウォームアップフェーズの必要性が解消されるか?
  • RQ4肘、手首、足首、耳といった困難な関節について、提案手法は強力なベースラインと比べてどの程度の性能を示すか?
  • RQ5明示的な3次元監視なしに、多様なポーズやオクルージョンに対しても一般化性能を示せるか?

主な発見

  • ボディオンリーポーズタスクにおいて、弱教師付きモデルは平均3次元誤差71.019 mmを達成したのに対し、強い教師付きベースラインは71.013 mmであった。
  • ボディとハンドを含む構成では、弱教師付きモデルの誤差は87.015 mmであり、強い教師付きモデルの84.115 mmと比べてわずか3 mm高いにとどまる。
  • 弱教師付きアプローチは、通常推定が難しい左・右の肘および手首において、強い教師付きモデルを上回る性能を示した。
  • モデルは、弱教師付きベースラインとほぼ同一の質的結果を示し、両者とも視覚例においてパノプティックの3次元真値をよく再現していた。
  • 失敗事例は、2次元検出の誤り(例:誤検出された手や遮蔽された四肢)に起因しており、弱教師付きアーキテクチャ自体の制限によるものではなかった。
  • 本手法は、3次元真値を一切使用せず、パノプティックデータセットで最先端の性能を達成し、マルチビュー整合性正則化子の有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。