Skip to main content
QUICK REVIEW

[論文レビュー] Multi-View Multi-Person 3D Pose Estimation with Plane Sweep Stereo

Jiahao Lin, Gim Hee Lee|arXiv (Cornell University)|Apr 6, 2021
Human Pose and Action Recognition参考文献 23被引用数 4
ひとこと要約

本稿では、明示的なクロスビュー対応マッチングを回避する多視点多人像3次元ポーズ推定のためのプレーンスイープステレオベース手法を提案する。平面スイープと粗〜細かい段階の深度推定スキームを活用することで、視点間の幾何的整合性を活かし、従来の学習ベース手法(例:VoxelPose)と比較して最大20倍高速でありながら、最先端の精度を達成する。

ABSTRACT

Existing approaches for multi-view multi-person 3D pose estimation explicitly establish cross-view correspondences to group 2D pose detections from multiple camera views and solve for the 3D pose estimation for each person. Establishing cross-view correspondences is challenging in multi-person scenes, and incorrect correspondences will lead to sub-optimal performance for the multi-stage pipeline. In this work, we present our multi-view 3D pose estimation approach based on plane sweep stereo to jointly address the cross-view fusion and 3D pose reconstruction in a single shot. Specifically, we propose to perform depth regression for each joint of each 2D pose in a target camera view. Cross-view consistency constraints are implicitly enforced by multiple reference camera views via the plane sweep algorithm to facilitate accurate depth regression. We adopt a coarse-to-fine scheme to first regress the person-level depth followed by a per-person joint-level relative depth estimation. 3D poses are obtained from a simple back-projection given the estimated depths. We evaluate our approach on benchmark datasets where it outperforms previous state-of-the-arts while being remarkably efficient. Our code is available at https://github.com/jiahaoLjh/PlaneSweepPose.

研究の動機と目的

  • 多視点多人像3次元ポーズ推定におけるクロスビュー対応マッチングの課題に取り組む。これは段階的なパイプラインにおいて誤差が蓄積されやすく、性能を低下させる要因となる。
  • 明示的なマッチングではなく、幾何的整合性を活用した同時統合により、エンドツーエンドで1回のスナップショットで3次元ポーズ推定を実現する。
  • 3次元ボクセルベース手法(例:VoxelPose)と比較して、スパースなシーンにおける重い3次元畳み込みのコストを軽減する計算効率の向上を図る。
  • 3次元シーンボリュームやカメラレイアウトに関する事前知識がなくても、異なるカメラ構成に一般化可能であることを目指す。
  • 粗〜細かいスキームを用いて、各2次元ポーズキーポイントの深度推定を高精度に実現するとともに、暗黙的な多視点整合性を活用する。

提案手法

  • 本手法は、ターゲットカメラビューにおける各2次元ポーズ関節の深度推定を、プレーンスイープステレオを用いて行う。ここで、仮想的な深度平面をバックプロジェクションし、参照ビューにワープする。
  • 各深度レベルにおいて、視点間の特徴をワープして比較することで、クロスビュー整合性を測定し、深度推定ネットワークのガイドラインとする。
  • 粗〜細かい段階の2段階深度推定を採用:まず人物単位の深度を推定し、次に狭い範囲内での関節単位の相対的深度を推定する。
  • 深度予測結果を用いて2次元ポーズを3次元空間にバックプロジェクションし、視点間で距離ベースのクラスタリングにより統合することで3次元ポーズを構築する。
  • ボリューム全体にわたる3次元畳み込みではなく、各2次元ポーズごとに1次元畳み込みを用いることで、計算コストを著しく削減する。
  • パイプライン全体をエンドツーエンドで学習し、明示的な2次元ポーズマッチングやトリアングレーションを必要としない。

実験結果

リサーチクエスチョン

  • RQ1多視点多人像3次元ポーズ推定において、プレーンスイープステレオを2次元ポーズ検出の関節レベル深度推定に効果的に適応できるか?
  • RQ2粗〜細かい深度推定スキームは、計算効率を維持しつつ精度を向上させられるか?
  • RQ3プレーンスイープによる暗黙的な多視点整合性は、複雑なシーンにおいて明示的なクロスビュー対応マッチングを上回る性能を発揮するか?
  • RQ43次元シーンレイアウトに関する事前知識がなくても、異なるカメラ構成に一般化できるか?
  • RQ53次元ボクセルベース手法と比較して、著しく低い推論コストで最先端の性能を達成できるか?

主な発見

  • Campusデータセットでは97.0%の平均精度を達成し、前回の最先端手法(96.7%)を上回った。
  • Shelfデータセットでは97.9%の平均精度を達成し、前回手法の97.4%から向上した。
  • CMU PanopticデータセットではMPJPEが16.75mmに低下し、VoxelPoseの17.68mmから0.93mm改善した。
  • VoxelPoseと比較して最大20倍高速な推論を達成し、リアルタイムアプリケーションに適したフレームレートを達成した。
  • 2台のカメラでの実験でも92%を超える精度を維持し、視認性が低い状況でも頑健であることを示した。
  • 訓練時にランダムなカメラセットを用いても、テスト時に固定されたカメラ構成で同等の性能を発揮し、カメラ構成への一般化性が優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。