Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Severe Occlusion: Multi-Person 3D Pose Estimation with Gated Convolution

Renshu Gu, Gaoang Wang|arXiv (Cornell University)|Oct 31, 2020
Human Pose and Action Recognition参考文献 35被引用数 4
ひとこと要約

本論文は、新しい移動カメラデータセット(MMHuman)のモーションキャプチャアノテーション付きデータを活用して、重度のオクルージョン下における多人数3次元人体ポーズ推定のための時系列ゲート付き畳み込みネットワークを提案する。ゲート付き畳み込みを用いて欠損した3次元関節を回復し、時間的整合性と3次元から2次元へのバックプロジェクションを統合することで、特にオクルージョン状況下でSOTA手法を上回る精度を達成する。

ABSTRACT

3D human pose estimation (HPE) is crucial in many fields, such as human behavior analysis, augmented reality/virtual reality (AR/VR) applications, and self-driving industry. Videos that contain multiple potentially occluded people captured from freely moving monocular cameras are very common in real-world scenarios, while 3D HPE for such scenarios is quite challenging, partially because there is a lack of such data with accurate 3D ground truth labels in existing datasets. In this paper, we propose a temporal regression network with a gated convolution module to transform 2D joints to 3D and recover the missing occluded joints in the meantime. A simple yet effective localization approach is further conducted to transform the normalized pose to the global trajectory. To verify the effectiveness of our approach, we also collect a new moving camera multi-human (MMHuman) dataset that includes multiple people with heavy occlusion captured by moving cameras. The 3D ground truth joints are provided by accurate motion capture (MoCap) system. From the experiments on static-camera based Human3.6M data and our own collected moving-camera based data, we show that our proposed method outperforms most state-of-the-art 2D-to-3D pose estimation methods, especially for the scenarios with heavy occlusions.

研究の動機と目的

  • 重度のオクルージョン下でも正確なアノテーションが得られる、現実世界の移動カメラ、多人数3次元ポーズデータセットの不足に対処する。
  • 重度の自己または他者によるオクルージョンに起因する関節の欠損を回復できる、頑健な3次元ポーズ推定手法を開発する。
  • 静的カメラベンチマークでは不十分な、困難な現実世界の動画シーケンスにおける一般化性と性能を向上させる。
  • 時間的連続性と3次元から2次元へのバックプロジェクションを活用して、カメラ座標系におけるポーズの局所化を実現するグローバルトラジェクトリ推定手法を導入する。
  • 今後の動的カメラ条件下でのオクルージョンに強い3次元人体ポーズ推定研究を支援するため、新しいベンチマークデータセット(MMHuman)を提供する。

提案手法

  • 長距離依存性をモデル化し、2次元ポーズシーケンスから欠損した3次元関節を回復するため、時系列回帰ネットワークにゲート付き畳み込みモジュールを組み込む。
  • ルート関節を基準とした正規化された3次元ポーズ表現を用い、その後、3次元から2次元へのバックプロジェクションと時間的整合性を用いてグローバルトラジェクトリ回復を実行する。
  • 画像補填(inpainting)にインspiredされたゲート付き畳み込みを適用し、可視関節にのみ注目し、文脈に基づいて欠損した関節を再構築する。
  • オクルージョンパターンへの耐性を高めるために、現実世界のオクルージョン付きシーケンスと合成データの組み合わせでモデルを訓練する。
  • 2段階パイプラインを採用:OpenPoseを用いた2次元キーポイント検出(信頼度スコア付)の後、ゲート付き時系列ネットワークによる2次元から3次元へのリフトング。
  • 関節ごとのL2損失と時間的滑らかさ正則化を組み合わせた、新しい損失関数を導入し、フレーム間でのポーズの一貫性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1重度のオクルージョン下でも、時系列ゲート付き畳み込みネットワークが2次元関節から3次元ポーズを効果的に回復できるか?
  • RQ2本手法は、重度の他者および自己オクルージョン下で、SOTAの2次元から3次元へのリフトングモデルと比較して、どの程度高い精度を達成するか?
  • RQ3グローバルトラジェクトリ推定手法は、移動カメラシナリオにおいて、局所化精度をどの程度向上させるか?
  • RQ4複雑なオクルージョンを持つ新しい実世界データセットでファインチューニングした場合、モデルの汎化性能はどの程度か?
  • RQ5移動カメラと濃厚なオクルージョンを持つ新たに収集されたデータセット(MMHuman)において、本手法は既存のアプローチを上回る性能を示せるか?

主な発見

  • Human3.6Mデータセットにおいて、50%のオクルージョン下で本手法は3次元ポーズ誤差43.8 mmを達成し、VideoPose3D(53.2 mm)や他のSOTA手法を上回った。
  • 新規のMMHumanデータセットにおいて、本手法は平均誤差78.3 mmを達成し、Hossainら(118.5 mm)、Pavlloら(84.2 mm)、Linら(114.9 mm)を著しく上回った。
  • 定性的な結果から、本手法は全身オクルージョン時でさえ自然で一貫性のあるポーズ推定を維持している一方、VideoPose3Dは不自然な肢の配置を示した。
  • 本手法はオクルージョンに対して頑健であり、特に困難なシーケンス(例:'Kungfu' および 'PullUp')において、VideoPose3Dに比べ12.5%の相対的誤差低減を達成した。
  • グローバルトラジェクトリ推定手法は、追加の教師信号を必要とせず、カメラ座標系での正確な局所化を実現し、オクルージョン状況下でVideoPose3Dの別個のトラジェクトリネットワークを上回った。
  • ファインチューニングなしで、MMHumanデータセットの未学習の動作に対してもモデルは良好なゼロショット一般化を示し、現実世界のオクルージョンパターンへの強い一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。