Skip to main content
QUICK REVIEW

[論文レビュー] Learning 3D Human Pose from Structure and Motion

Rishabh Dabral, Anurag Mundhada|arXiv (Cornell University)|Nov 25, 2017
Human Pose and Action Recognition参考文献 40被引用数 7
ひとこと要約

本稿では、関節角の制限と左右対称性という解剖学的インスピレーションを受ける損失関数に加え、時間的ポーズ精錬ネットワークを組み合わせることで、屋外環境における一般化性能を向上させる弱教師付き3次元人体ポーズ推定フレームワークを提案する。大規模な2次元および合成3次元データ上で学習することで、コンsumer GPU上で30 FPSで実行可能であり、Human3.6MおよびMPI-INF-3DHPの両ベンチマークでそれぞれ11.8%および12%の性能向上を達成し、最先端の性能を実現した。

ABSTRACT

3D human pose estimation from a single image is a challenging problem, especially for in-the-wild settings due to the lack of 3D annotated data. We propose two anatomically inspired loss functions and use them with a weakly-supervised learning framework to jointly learn from large-scale in-the-wild 2D and indoor/synthetic 3D data. We also present a simple temporal network that exploits temporal and structural cues present in predicted pose sequences to temporally harmonize the pose estimations. We carefully analyze the proposed contributions through loss surface visualizations and sensitivity analysis to facilitate deeper understanding of their working mechanism. Our complete pipeline improves the state-of-the-art by 11.8% and 12% on Human3.6M and MPI-INF-3DHP, respectively, and runs at 30 FPS on a commodity graphics card.

研究の動機と目的

  • 実世界の3次元アノテーションデータが不足しているため、制約のない屋外環境における3次元人体ポーズ推定の課題に対処すること。
  • トレーニング段階で関節角の制限や左右対称性といった解剖学的制約を組み込むことで、3次元ポーズ推定モデルの一般化性能を向上させること。
  • 遅延を引き起こすフィルタを導入せずに、動画ベースのポーズ推定における時間的整合性を向上させること。
  • 既存手法を上回る性能を達成しながら、30 FPSのリアルタイム推論を実現すること。
  • 3次元ポーズ推定のエンドツーエンドディープラーニングフレームワークにおいて、微分可能で学習可能な構造的事前知識の有効性を示すこと。

提案手法

  • 関節角の制限に違反する予測3次元ポーズに対してペナルティを与える構造に配慮した損失関数を導入し、解剖学的に妥当な構成を保証する。
  • 対応する左右の骨ペア間のL1距離を最小化する対称性損失を提案し、左右対称性を強制する。
  • 先行研究からのボーン長比事前知識を組み合わせ、包括的な解剖学的正則化スキームを構築する。
  • N個の連続した予測ポーズを入力として受け取るスライディングウィンドウ型全結合時間ネットワークを設計し、運動の整合性を向上させる。
  • 大規模な屋外2次元および屋内/合成3次元データセット上で、弱教師付き学習を用いてモデルをエンドツーエンドで学習する。
  • 損失関数の挙動と影響を解釈するため、損失関数の表面可視化と感度分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1微分可能で学習可能な解剖学的制約(関節角の制限と対称性)が、制約のない環境下での3次元ポーズ推定の一般化性能を向上させることができるか?
  • RQ2構造に配慮した損失関数は、先行研究のボーン長比事前知識と比較して、性能と解剖学的妥当性の両面で優れているか?
  • RQ3単純な時間ネットワークが、遅延を引き起こさずにポーズのなめらかさを向上させ、ジターリダムを低減できる程度はどの程度か?
  • RQ4構造的モデリングと時間的モデリングの組み合わせが、Human3.6M や MPI-INF-3DHP といった標準ベンチマークで最先端の性能を達成できるか?
  • RQ5損失関数の表面解析から、提案された損失関数が最適化の多様性にどのように影響を与えるか?

主な発見

  • 提案された構造に配慮した損失関数により、不正な関節角の割合が0.8%([41]と比較して1.4%)にまで低下し、顕著に解剖学的妥当性が向上した。
  • SAP-Netは、プロトコル1の下でHuman3.6Mで55.5mmのMPJPEを達成し、最先端性能を11.8%向上させた。
  • 時間的モデル(TP-Net)を追加することで、Human3.6MにおけるMPJPEは52.1mmに改善され、さらに7%の向上を達成した。
  • MPI-INF-3DHPでは、グリーンスクリーンデータ拡張を一切使用していないにもかかわらず、103.8mmのMPJPEを達成し、先行研究の最先端性能を12%上回った。
  • 対称性損失により、上腕部では左右の骨ペア間の平均L1距離が31.7%、大腿部では42.8%減少し、強い対称性の強制が確認された。
  • TP-Netにより、フレーム間のボーン長の標準偏差が28.7%低下し、後処理フィルタを用いずに時間的安定性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。