Skip to main content
QUICK REVIEW

[論文レビュー] Faster VoxelPose: Real-time 3D Human Pose Estimation by Orthographic Projection

Hang Ye, Wentao Zhu|arXiv (Cornell University)|Jul 22, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

Faster VoxelPose は、3次元特徴ボリュームを2次元正射影平面(xy、xz、yz)に再投影することで、リアルタイムな3次元人体ポーズ推定を実現する手法を提案する。これにより、高コストな3次元畳み込みニューラルネットワーク(3D-CNN)の代わりに効率的な2次元畳み込みニューラルネットワーク(2D-CNN)を用いた関節座標推定が可能となり、VoxelPoseと比較して約10倍の高速化を達成しながら、最先端の精度を維持する。3次元人体検出器と適応的融合機構を用いることで、投影間の曖昧さや不整合を解消する。

ABSTRACT

While the voxel-based methods have achieved promising results for multi-person 3D pose estimation from multi-cameras, they suffer from heavy computation burdens, especially for large scenes. We present Faster VoxelPose to address the challenge by re-projecting the feature volume to the three two-dimensional coordinate planes and estimating X, Y, Z coordinates from them separately. To that end, we first localize each person by a 3D bounding box by estimating a 2D box and its height based on the volume features projected to the xy-plane and z-axis, respectively. Then for each person, we estimate partial joint coordinates from the three coordinate planes separately which are then fused to obtain the final 3D pose. The method is free from costly 3D-CNNs and improves the speed of VoxelPose by ten times and meanwhile achieves competitive accuracy as the state-of-the-art methods, proving its potential in real-time applications.

研究の動機と目的

  • マルチビュー3次元人体ポーズ推定における3次元畳み込みニューラルネットワーク(3D-CNN)ベースのボクセル手法の高い計算コストを低減すること。特に大規模シーンにおいて有効であることを目的とする。
  • 正射影による特徴再投影を通じて、高コストな3次元畳み込みを効率的な2次元畳み込みニューラルネットワーク(2D-CNN)に置き換えることで、リアルタイム推論を実現すること。
  • 密な人物の重なりによる2次元投影における曖昧さを、タイトなバウンディングボックスを備えた学習済み3次元人体検出ネットワーク(HDN)を用いて解消すること。
  • 検出された3次元ボクセルボックスに応じて特徴ボリュームをマスクすることで、人物ごとの特徴を分離し、関節位置の推定精度を向上させること。
  • 不一致した予測を解消するための信頼度を考慮した融合ネットワークを開発すること。

提案手法

  • 3次元特徴ボリュームを3つの2次元座標平面(xy、xz、yz)に正射影することで再投影し、2次元畳み込みニューラルネットワーク(2D-CNN)による処理を可能にする。
  • 人体検出ネットワーク(HDN)を用い、xy平面における2次元バウンディングボックスで人物を局所化し、z軸方向の列特徴に対して1次元畳み込みニューラルネットワーク(1D-CNN)を用いて身長を推定する。
  • 検出された3次元バウンディングボックス内に、人物固有の3次元ボリュームをマスクすることで、他の人物からの干渉を低減する。
  • 各2次元投影平面から、専用の2次元畳み込みニューラルネットワーク(2D-CNN)を用いて部分的な3次元座標(X、Y、Z)を推定し、各座標に対して2つの推定値を生成する。
  • 信頼度重みを割り当てることで不一致を低減する学習可能な重み付き融合ネットワークを用いて、二重平面からの予測を統合する。
  • 可変なボクセル粒度を用いることで、速度と精度のバランスを調整し、計算複雑度が立方的にではなく、平方的に増加するように設計する。

実験結果

リサーチクエスチョン

  • RQ1正射影による特徴再投影を通じて、3次元畳み込みニューラルネットワーク(3D-CNN)を2次元畳み込みニューラルネットワーク(2D-CNN)に置き換えることで、3次元人体ポーズ推定を著しく高速化しつつ、精度を損なわずに行えるか?
  • RQ2大規模シーンにおける関節局所化の際、2次元投影における重なった人物の曖昧さは、どのように解消できるか?
  • RQ3床面の位置特定と身長推定を分離する3次元人体検出器(HDN)は、特徴マスクとポーズ精度の向上に寄与するか?
  • RQ4複数の2次元投影からの不一致した予測を効果的に統合し、信頼性の高い3次元関節座標を生成する方法は何か?
  • RQ5本手法は、カメラ数や人物数の増加に伴い、大規模で混雑したシーンへどのようにスケーリングできるか?

主な発見

  • Faster VoxelPose は、標準ベンチマーク上での VoxelPose と比較して10倍の高速化を達成しながら、CMU Panoptic ではMPJPEが18.26mmという競争力のある精度を維持した。
  • アブレーションスタディの結果、特徴マスクによりAP50が96.75%から98.08%に向上し、人物間干渉の低減に寄与することが確認された。
  • 適応的重み付き融合により、MPJPEが20.11mm(平均融合)から18.26mmに低下し、信頼度に基づく集約の有効性が裏付けられた。
  • 粗いボクセル(32×32×32)を用いることで、MACsが8.67Gから2.17Gに75%削減され、MPJPEはわずか2.1mm増加にとどまり、速度と精度のトレードオフが可能になった。
  • 8m×8mのシーンから16m×16mのシーンにスケーリングし、カメラ数を12台に増加させた場合、推論時間はたった28.8%しか増加しなかった。これは、先行手法に比べて優れたスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。