Skip to main content
QUICK REVIEW

[論文レビュー] Occluded Human Body Capture with Self-Supervised Spatial-Temporal Motion Prior

Buzhen Huang, Yuan Shu|arXiv (Cornell University)|Jul 12, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文では、非遮蔽データから学習した自己教師あり空間時間的運動事前分布を用いて、遮蔽下の単眼3次元人体モーショントラッキングを改善する手法を提案する。2次元モーショントラッキングをマップにエンコードし、合成遮蔽を施すことにより、マスク画像モデリングを用いたジョイントレベルの空間時間的ネットワークを訓練する。実際の遮蔽動画から高精度かつ一貫性のある3次元モーショントラッキングを実現し、一般化性能と効率性に優れる。

ABSTRACT

Although significant progress has been achieved on monocular maker-less human motion capture in recent years, it is still hard for state-of-the-art methods to obtain satisfactory results in occlusion scenarios. There are two main reasons: the one is that the occluded motion capture is inherently ambiguous as various 3D poses can map to the same 2D observations, which always results in an unreliable estimation. The other is that no sufficient occluded human data can be used for training a robust model. To address the obstacles, our key-idea is to employ non-occluded human data to learn a joint-level spatial-temporal motion prior for occluded human with a self-supervised strategy. To further reduce the gap between synthetic and real occlusion data, we build the first 3D occluded motion dataset~(OcMotion), which can be used for both training and testing. We encode the motions in 2D maps and synthesize occlusions on non-occluded data for the self-supervised training. A spatial-temporal layer is then designed to learn joint-level correlations. The learned prior reduces the ambiguities of occlusions and is robust to diverse occlusion types, which is then adopted to assist the occluded human motion capture. Experimental results show that our method can generate accurate and coherent human motions from occluded videos with good generalization ability and runtime efficiency. The dataset and code are publicly available at \url{https://github.com/boycehbz/CHOMP}.

研究の動機と目的

  • 同じ2次元観測値に対して複数の3次元ポーズが対応する可能性があるため、遮蔽された単眼動画からの3次元人体モーショントラッキングにおける本質的曖昧性に対処すること。
  • 実世界の遮蔽付き3次元モーショントラッキングデータが不足している問題を克服し、合成データから実データへの一般化が可能なベンチマークを新規に構築すること。
  • 非遮蔽データから学習したジョイントレベルの空間時間的相関を活用することで、遮蔽状況下でのモーショントラッキングの精度と時間的整合性を向上させること。
  • 実際の遮蔽アノテーションを必要とせず、曖昧性を低減するための自己教師あり学習戦略を構築すること。
  • 時間的および運動学的事前分布を活用した軽量ネットワークを訓練することで、リアルタイム性能を実現する効率的な推論を可能とすること。

提案手法

  • 空間的および時間的情報を統合的に表現できるように、2次元人体モーショントラッキングをモーショントラップに変換し、非遮蔽データ上で一貫性のある遮蔽を合成可能にする。
  • 非遮蔽2次元モーショントラップに現実的な遮蔽を合成し、自己教師あり事前学習中に多様な遮蔽タイプを模擬する。
  • 入力が遮蔽された状態から完全なモーショントラップを再構築する自己教師ありマスク画像モデリング(MIM)タスクを設計し、頑健なモーショントラップ事前分布を学習する。
  • ドーナツ型畳み込みとビジョントランスフォーマーブロックを組み合わせた空間時間層を提案し、ジョイントレベルの空間的相関とグローバルなモーショントラップ依存関係をモデル化する。
  • 自己教師あり事前分布を用いて、実際の遮蔽状況下での可視2次元ジョイントから3次元モーショントラップ推定をガイドするリフトネットワークを訓練する。
  • 推論段階では、最先端の2次元ポーズ検出器を用いて可視ジョイント座標を抽出し、その情報をモデルに入力して完全な3次元モーショントラップを予測する。

実験結果

リサーチクエスチョン

  • RQ1非遮蔽データから学習した自己教師あり事前分布は、遮蔽下の3次元モーショントラップ推定における曖昧性を効果的に低減できるか?
  • RQ2純粋に時間的モデルと比較して、ジョイントレベルの空間時間的モデリングは遮蔽状況下でのモーショントラップの整合性と精度をどのように向上させるか?
  • RQ3実際の遮蔽アノテーションが存在しない状況下でも、本手法は多様な遮蔽タイプと割合に一般化できるか、その程度はどの程度か?
  • RQ4非遮蔽データに合成遮蔽を施すことで、実世界の遮蔽データとのドメインギャップを効果的に埋め合わせられるか?
  • RQ5自己教師あり事前分布の統合は、エンドツーエンド最適化ベースの手法と比較して、実行時間効率と予測品質をどのように向上させるか?

主な発見

  • 提案手法は、OcMotionデータセットにおいて平均MPJPEが58.2 mmを達成し、ベースライン時間的モデル(70.5 mm)およびアブレーションバリアントを顕著に上回った。
  • 自己教師あり事前分布と空間時間層を追加したことで、ベースラインと比較してMPJPEが12.3%低下し、PVEも12.1%低下した。
  • 遮蔽率が0%から50%にわたる範囲でも性能劣化が最小限に抑えられ、遮蔽割合の変動に対してもロバストであることが示された。
  • 自己教師あり事前分布の導入により、PA-MPJPEはアノテーションなしの状態(43.2 mm)から36.1 mmに改善され、ジョイントレベルの精度が向上した。
  • 推論速度は36.4 FPSを達成し、リアルタイム応用に適した高い実行効率を示した。
  • アブレーションスタディにより、空間時間層と自己教師あり事前分布の両方が不可欠であることが確認され、完全なモデルは他のバリエーションを大きく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。