[論文レビュー] Explicit Occlusion Reasoning for Multi-person 3D Human Pose Estimation
本稿では、可視ヒンジを用いて遮蔽された関節を明示的に推論するHUPORという、マルチパーソン3次元人体ポーズ推定のための新規フレームワークを提案する。Deeply Supervised Encoder Distillation (DSED)ネットワークを用いて可視キーポoin検出と遮蔽されたキーポイントの推論を分離し、Skeleton-guided Shape Fitting (SSF)手法を用いて正確な擬似遮蔽ラベルを生成することで、複数のベンチマークで最先端の性能を達成し、重度の遮蔽下でも著しく高いロバスト性を示す。
Occlusion poses a great threat to monocular multi-person 3D human pose estimation due to large variability in terms of the shape, appearance, and position of occluders. While existing methods try to handle occlusion with pose priors/constraints, data augmentation, or implicit reasoning, they still fail to generalize to unseen poses or occlusion cases and may make large mistakes when multiple people are present. Inspired by the remarkable ability of humans to infer occluded joints from visible cues, we develop a method to explicitly model this process that significantly improves bottom-up multi-person human pose estimation with or without occlusions. First, we split the task into two subtasks: visible keypoints detection and occluded keypoints reasoning, and propose a Deeply Supervised Encoder Distillation (DSED) network to solve the second one. To train our model, we propose a Skeleton-guided human Shape Fitting (SSF) approach to generate pseudo occlusion labels on the existing datasets, enabling explicit occlusion reasoning. Experiments show that explicitly learning from occlusions improves human pose estimation. In addition, exploiting feature-level information of visible joints allows us to reason about occluded joints more accurately. Our method outperforms both the state-of-the-art top-down and bottom-up methods on several benchmarks.
研究の動機と目的
- モノクローラルマルチパーソン3次元人体ポーズ推定における遮蔽の持続的課題に対処すること。これは、現実世界のシナリオで性能を著しく低下させる。
- 未知の遮蔽パターンに一般化しにくいポーズ事前知識や、暗黙的な推論に依存する既存手法の限界を克服すること。
- 人間が可視関節と文脈的情報から遮蔽された関節を推論する能力を模倣することで、遮蔽の明示的推論を可能にすること。
- 既存データセットに個々の関節の可視性アノテーションが欠落しているため、トレーニング用に正確な擬似遮蔽ラベルを生成すること。
- 検出とグルーピングのロバスト性を向上させる推論モジュールを統合することで、2次元および3次元人体ポーズ推定の両方を改善すること。
提案手法
- 本手法は3次元人体ポーズ推定を2段階に分割する:(1) 最先端のボトムアップ検出器を用いた可視キーポイント検出、(2) 専用モジュールを用いた遮蔽されたキーポイント推論。
- 可視関節と文脈的情報からの特徴表現を活用することで、遮蔽された関節を明示的に推論するためのDeeply Supervised Encoder Distillation (DSED)ネットワークを提案する。
- パラメトリックなSMPLモデルを画像にフィッティングし、投影に基づく可視性チェックを用いることで、正確な擬似遮蔽ラベルを生成するSkeleton-guided Shape Fitting (SSF)手法を導入する。
- 2次元/3次元ポーズベースと画像ベースのフィッティングを組み合わせることで、自己遮蔽、物体遮蔽、人物間の相互遮蔽を検出可能にすることで、従来の形状フィッティングを改善する。
- 推論モジュールは生成された擬似遮蔽ラベルを用いてトレーニングされ、手動アノテーションを必要とせずに明示的な遮蔽推論を学習可能になる。
- 推論モジュールの深さに依存するコンponentsを変更することで、2次元および3次元ポーズ推定の両方と互換性を持つ。
実験結果
リサーチクエスチョン
- RQ1明示的な遮蔽推論は、重度の遮蔽下におけるマルチパーソン3次元人体ポーズ推定のロバスト性を著しく向上させることができるか?
- RQ2真の可視性アノテーションが存在しない状況で、トレーニング用に正確な擬似遮蔽ラベルをどのように生成できるか?
- RQ3可視関節特徴を活用する専用の推論モジュールは、エンドツーエンドまたは暗黙的推論アプローチを上回る性能を発揮できるか?
- RQ4標準のアワークラスまたはトランスフォーマー基盤のアーキテクチャと比較して、DSEDネットワークは遮蔽されたキーポイント予測をどの程度改善するか?
- RQ5提案手法は2次元人体ポーズ推定にも一般化可能であり、深さの監視なしに性能を向上させることができるか?
主な発見
- HUPORはCOCO test-dev 2017ベンチマークで最先端の性能を達成し、DSED推論モジュールを用いることでAPを68.4から69.5に向上させた。
- 3DPWデータセットでは、MPJPEを80.0から79.1に、PA-MPJPEを48.8から49.3に低下させ、メッシュ回復精度の向上を示した。
- SSF手法は88.5%の精度と80.5%の再現率を達成し、Cylinder(65.3%精度)やHybrIK(80.0%精度)といったベースライン手法を著しく上回った。
- 推論モジュールを追加することで、COCO上での2次元ポーズ推定性能が最大1.7 AP向上し、3次元タスクを超えた一般化能力を示した。
- DSEDネットワークは不可欠である:これを削除するとCOCOで2 AP以上性能が低下し、遮蔽推論に適切な特徴蒸留を実現していることが確認された。
- 定性的な比較により、人物の欠落、余分な人物の検出、遮蔽下での不完全なスケルトンの発生といった一般的な失敗事例が削減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。