Skip to main content
QUICK REVIEW

[論文レビュー] Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled Representation

Edoardo Remelli, Shangchen Han|arXiv (Cornell University)|Apr 5, 2020
Human Pose and Action Recognition参考文献 33被引用数 9
ひとこと要約

本稿では、カメラに依存しない表現学習を用いた軽量でリアルタイムなマルチビュー3D人体ポーズ推定手法を提案する。2D特徴量をカメラに依存しない潜在空間に統合し、GPU最適化された微分可能DLT層を適用することで、H36MおよびTotal Captureで最先端の精度を達成しつつ、約25FPSで動作し、追加データを必要とせずに計算コストの高いボリュメトリックベースラインを上回る。

ABSTRACT

We present a lightweight solution to recover 3D pose from multi-view images captured with spatially calibrated cameras. Building upon recent advances in interpretable representation learning, we exploit 3D geometry to fuse input images into a unified latent representation of pose, which is disentangled from camera view-points. This allows us to reason effectively about 3D pose across different views without using compute-intensive volumetric grids. Our architecture then conditions the learned representation on camera projection operators to produce accurate per-view 2d detections, that can be simply lifted to 3D via a differentiable Direct Linear Transform (DLT) layer. In order to do it efficiently, we propose a novel implementation of DLT that is orders of magnitude faster on GPU architectures than standard SVD-based triangulation methods. We evaluate our approach on two large-scale human pose datasets (H36M and Total Capture): our method outperforms or performs comparably to the state-of-the-art volumetric methods, while, unlike them, yielding real-time performance.

研究の動機と目的

  • 3D畳み込みネットワークに依存する従来のボリュメトリックマルチビュー3Dポーズ推定手法の計算非効率性を解消すること。
  • VRヘッドセットなどの低計算リソースデバイスでもリアルタイム3Dポーズ推定を可能にするために、高価な3Dグリッド演算を回避すること。
  • 分離された標準化特徴統合メカニズムにより、複数のビューにおける2Dキーポoinト検出精度を向上させること。
  • 精度を損なわずに、推定速度を向上させるGPU最適化されたDLT実装を開発すること。
  • トレーニング時に見られなかったカメラ視点に対しても一般化できることを保証し、耐障害性と柔軟性を高めること。

提案手法

  • 共有バックボーンネットワークを用いて各入力画像を潜在表現に変換し、特徴変換層によってカメラ視点から分離する。
  • カメラに依存しない特徴量を1次元畳み込みにより統合し、標準座標フレームにおける統一された3Dポーズ表現に変換する。
  • 投影行列を条件として用い、各ビューごとに浅い2次元CNNで2D関節位置を復元する。
  • 微分可能な直接線形変換(DLT)層を用いて2D検出結果を3Dに変換し、エンドツーエンドの学習を可能にする。
  • SVDに代わるシフトされた反復手法を用いた新規なGPU加速DLT実装を実装し、標準的なSVDベース手法と比較して約100倍の高速化を達成する。
  • DLT層を逆伝播可能にすることで、3D MPJPE損失を最適化するエンドツーエンドのパイプラインを訓練する。

実験結果

リサーチクエスチョン

  • RQ1計算コストの高い3Dボリュメトリックネットワークに依存せずに、マルチビュー3Dポーズ推定をリアルタイムで実現できるか?
  • RQ2カメラに依存しない潜在表現は、独立した単眼推定と比較して、複数のビューにおける2Dキーポイント検出精度を向上させられるか?
  • RQ3SVDベースの三角測量を置き換えられる、微分可能で効率的なDLT実装は、精度を損なわずに深層学習パイプラインに統合可能か?
  • RQ4トレーニング時に見られなかったカメラ視点に対しても、この手法はどれほど一般化できるか?
  • RQ5提案手法は、最小限のモデルサイズと推論遅延を維持しながら、最先端の精度を達成できるか?

主な発見

  • 提案されたCanonical Fusion手法は、TotalCaptureデータセットにおいて、単純な特徴統合と比較して約10%、単眼ベースラインと比較して約18%の2D検出精度向上を達成した。
  • DLT層を経由したエンドツーエンド学習により、非微分可能バージョンと比較して3D MPJPEが7%改善され、共同最適化の有効性が示された。
  • Human3.6Mデータセットにおいて、追加の2Dアノテーションを用いた場合、本手法はIskakovら[17]の最先端ボリュメトリック手法をMPJPEで約20%上回った。
  • 単一GPU上での推論速度は約25FPS(40ms)であり、Iskakovら[17]のボリュメトリック手法と比較して約57倍、代数的三角測量ベースラインと比較して約50倍高速であった。
  • SOTAボリュメトリック手法(Iskakovら[17])と同等の精度を達成した一方で、モデルサイズは251MB(643MB)に比べて著しく小さく、はるかに高速であった。
  • 本手法は、トレーニング時とは異なるカメラ視点に対しても良好に一般化し、訓練環境を越えた耐障害性と柔軟性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。