Skip to main content
QUICK REVIEW

[論文レビュー] 3D Pose Detection in Videos: Focusing on Occlusion

Justin Wang, Edward Xu|arXiv (Cornell University)|Jun 24, 2020
Human Pose and Action Recognition参考文献 8被引用数 4
ひとこと要約

本稿では、スタックドアワーガラスネットワークからの2Dポーズ予測と、遮蔽に強い時系列畳み込みネットワーク(TCN)を統合することで、動画内の遮蔽された関節の精度を向上させる2段階の3次元人体ポーズ推定フレームワークを提案する。遮蔽ラベルの生成に洗練されたシリンダーマンモデルを導入し、修正された損失関数によりTCNを遮蔽された関節を明示的に認識できるように訓練することで、線形ベースラインと比較して5 mm低い平均関節位置誤差(MPJPE)を達成し、TCNオンリーベースラインと比較しても0.1 mm低いMPJPEを達成した。さらに、計算コストも低減された。

ABSTRACT

In this work, we build upon existing methods for occlusion-aware 3D pose detection in videos. We implement a two stage architecture that consists of the stacked hourglass network to produce 2D pose predictions, which are then inputted into a temporal convolutional network to produce 3D pose predictions. To facilitate prediction on poses with occluded joints, we introduce an intuitive generalization of the cylinder man model used to generate occlusion labels. We find that the occlusion-aware network is able to achieve a mean-per-joint-position error 5 mm less than our linear baseline model on the Human3.6M dataset. Compared to our temporal convolutional network baseline, we achieve a comparable mean-per-joint-position error of 0.1 mm less at reduced computational cost.

研究の動機と目的

  • 自己遮蔽や物体による遮蔽のため検出が困難な関節を含む、動画内での3次元人体ポーズ推定の精度を向上させること。
  • 遮蔽下でも一般化能力に欠ける既存の3次元ポーズ推定モデルの限界を克服し、時間的文脈と明示的な遮蔽信号を統合すること。
  • 3次元真値キーポイントから遮蔽ラベルを生成するためのシリンダーマンモデルのヒューリスティックを洗練させることで、より強固で効率的な遮蔽モデリング戦略を構築すること。
  • 2Dポーズ予測と遮蔽状態を組み合わせた時系列畳み込みネットワーク(TCN)を訓練し、正確な3次元ポーズ推定を実現すること。線形ベースラインおよび標準TCNベースラインを上回る性能を発揮すること。

提案手法

  • 本手法は、動画フレームを入力として、スタックドアワーガラスネットワークを用いて2次元キーポイント予測を生成し、主な3次元ポーズ推定パイプラインに供給する。
  • 遮蔽ラベルは、3次元真値キーポイントを2次元に投影し、カメラ視点での可視性に基づいて関節が遮蔽されているかどうかを判断する、修正されたシリンダーマンモデルヒューリスティックを用いて生成される。
  • 本手法の核となるモデルは、2次元関節座標と遮蔽ベクトルを入力とし、複数フレームにわたる3次元関節位置を予測することを目的とした時系列畳み込みネットワーク(TCN)である。
  • TCNは、真値の遮蔽ラベルを明示的に組み込んだ修正された損失関数で訓練され、遮蔽された関節をより効果的に推論できるように学習される。
  • フレームワークは、Human3.6MおよびHumanEva-Iデータセットで評価され、遮蔽モデリング戦略やネットワークバリアントの違いを比較するアブレーションスタディが実施された。
  • ガウスモデルに代わるクラスタリング遮蔽ヒューリスティックが導入され、特定の遮蔽パターンへの過学習を低減し、一般化性能を向上させた。

実験結果

リサーチクエスチョン

  • RQ1明示的な遮蔽信号を用いて訓練された時系列畳み込みネットワーク(TCN)は、標準ベースラインと比較して、動画シーケンスにおける遮蔽された関節の3次元ポーズ推定精度を向上させることができるか?
  • RQ2提案手法の遮蔽に強いTCNは、線形回帰ベースラインおよび標準TCNベースラインと比較して、平均関節位置誤差(MPJPE)の観点でどの程度優れているか?
  • RQ33次元真値キーポイントからの遮蔽ラベル生成に用いるシリンダーマンモデルのヒューリスティックを洗練させることで、関節が遮蔽されている場合の3次元ポーズ予測能力がどの程度向上するか?
  • RQ4損失関数に真値の遮蔽ラベルを組み込むことで、遮蔽された関節の誤差が低減し、一般化性能が向上するか?遮蔽ラベルの教師信号を用いないモデルと比較してどうなるか?
  • RQ5ガウスモデルよりも単純なヒューリスティック、例えばクラスタリング遮蔽モデルは、より複雑なヒューリスティックと同等またはそれ以上の性能を達成できるか?また、計算オーバーヘッドを低減できるか?

主な発見

  • 遮蔽に強いTCNは、Human3.6Mデータセットで平均関節位置誤差(MPJPE)23.01 mmを達成し、線形ベースラインと比較して5 mm低い値となった。
  • 標準TCNベースラインと比較して、提案手法は0.1 mm低いMPJPEを達成したが、計算コストは低減された。
  • 洗練されたシリンダーマンモデルを用いた遮蔽ラベル生成は、関節の遮蔽が顕著に見られる「SittingDown」のような動作において、モデル性能の向上に顕著に寄与した。
  • より積極的に関節を遮蔽とみなすクラスタリング遮蔽ヒューリスティックは、ベースラインのガウス遮蔽モデルを上回り、異なる遮蔽パターンにわたる一般化を促進することでモデルの頑健性を向上させた。
  • 「SittingDown」動作では、太ももの膝による股関節の遮蔽が一般的であるが、本モデルは時間的文脈と遮蔽信号を効果的に活用することで、優れた性能を発揮した。
  • 計算リソースの制限がある状況でも、ヒートマップの代わりに遮蔽ベクトルを使用した場合、Human3.6Mでのテスト誤差が50.36 mmに留まり、本手法の有効性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。