Skip to main content
QUICK REVIEW

[論文レビュー] EPro-PnP: Generalized End-to-End Probabilistic Perspective-n-Points for Monocular Object Pose Estimation

Hansheng Chen, Pichao Wang|arXiv (Cornell University)|Mar 24, 2022
Robotics and Sensor-Based Localization被引用数 7
ひとこと要約

EPro-PnP は、単眼 3D オブジェクト ポーズ推定のための 2D-3D キーポイント対応関係のエンドツーエンド学習を可能にする微分可能で確率的な Perspective-n-Points (PnP) レイヤーを導入する。SE(3)多様体上のポーズを確率分布としてモデル化し、予測されたポーズ分布と真値ポーズ分布の間の KL 発散を最小化することで、決定的 PnP の微分不能性を克服し、LineMOD および nuScenes ベンチマークで最先端の性能を達成する。

ABSTRACT

Locating 3D objects from a single RGB image via Perspective-n-Points (PnP) is a long-standing problem in computer vision. Driven by end-to-end deep learning, recent studies suggest interpreting PnP as a differentiable layer, so that 2D-3D point correspondences can be partly learned by backpropagating the gradient w.r.t. object pose. Yet, learning the entire set of unrestricted 2D-3D points from scratch fails to converge with existing approaches, since the deterministic pose is inherently non-differentiable. In this paper, we propose the EPro-PnP, a probabilistic PnP layer for general end-to-end pose estimation, which outputs a distribution of pose on the SE(3) manifold, essentially bringing categorical Softmax to the continuous domain. The 2D-3D coordinates and corresponding weights are treated as intermediate variables learned by minimizing the KL divergence between the predicted and target pose distribution. The underlying principle unifies the existing approaches and resembles the attention mechanism. EPro-PnP significantly outperforms competitive baselines, closing the gap between PnP-based method and the task-specific leaders on the LineMOD 6DoF pose estimation and nuScenes 3D object detection benchmarks.

研究の動機と目的

  • 決定的 PnP が微分不能であるため、トレーニングを妨げる単眼 3D オブジェクト ポーズ推定における 2D-3D 対応関係のエンドツーエンド学習の課題に対処する。
  • PnP を微分可能な確率的レイヤーに再定式化することで、完全な 2D-3D 対応関係の学習を初期から行う際の収束問題を克服する。
  • 注目メカニズムに類似した単一の確率的フレームワークに、既存の対応関係学習手法を統合する。
  • 6DoF ポーズ推定および 3D オブジェクト検出の両方において、可変的対応関係(特に可変的対応関係学習を含む)を柔軟かつ学習可能に可能にする。
  • LineMOD や nuScenes のような大規模ベンチマークにおいて、PnP に基づく手法とタスク固有の SOTA モデルとの性能ギャップを埋める。

提案手法

  • PnP 操作を逆伝播可能にするために、SE(3) ポーズ空間上の確率分布を出力する微分可能な確率的 PnP レイヤー EPro-PnP を提案する。
  • 2D イメージ座標、3D オブジェクト モデル座標、およびそれらに対応する注目重みを、KL 発散損失を用いて最適化可能なパラメータとして扱う。
  • 予測されたポーズ分布と真値ポーズ分布の間の KL 発散を効率的に計算するために、適応的多重重要度サンプリング (AMIS) を使用する。
  • CDPN や新規の可変的対応関係ネットワークなど、既存のネットワークに EPro-PnP を統合し、エンドツーエンド学習を可能にする。
  • 確率的定式化を活用して、対称的または不確実なオブジェクトにおけるマルチモーダルなポーズ分布をモデル化する。
  • 一般化性能および 3D 検出ベンチマークでの性能を向上させるために正則化とテスト時増強 (TTA) を適用する。

実験結果

リサーチクエスチョン

  • RQ1決定的 PnP の微分不能性は、2D-3D 対応関係のエンドツーエンド学習を可能にするために克服可能か?
  • RQ2PnP の確率的定式化は、ポーズ推定における勾配ベース最適化のための安定的で微分可能な代替手段を提供できるか?
  • RQ3SE(3) 上のポーズを分布としてモデル化することで、エンドツーエンド学習において決定的 PnP よりも一般化性能および性能が向上するか?
  • RQ4EPro-PnP は、固定または部分的に学習可能な対応関係を持つ既存の対応関係学習手法を統合し、それらを上回る性能を発揮できるか?
  • RQ5EPro-PnP は、可変的対応関係ネットワークのような新規なアーキテクチャを可能にし、完全なエンドツーエンド学習による高精度な 3D オブジェクト検出を実現できるか?

主な発見

  • EPro-PnP は LineMOD 6DoF ポーズ推定ベンチマークで最先端の性能を達成し、平均精度が 0.453 NDS に達した。これは、以前の SOTA 手法を上回る。
  • nuScenes 3D オブジェクト検出ベンチマークでは、基本的な EPro-PnP バージョンがバリデーションセットで 0.425 NDS を達成し、FCOS3D ベースライン(0.372 NDS)を上回った。
  • テスト時フリップ増強(TTA)を適用した場合、EPro-PnP は nuScenes バリデーションセットで 0.439 NDS を達成し、以前の SOTA を明確に上回った。
  • ベースライン手法と比較して、方向誤差(mAOE = 0.337)が顕著に低減され、ポーズ精度の向上が示された。
  • ノイズが多いか詳細が乏しい座標マップに対しても、EPro-PnP は CDPN ベースライン(79.96 mAP)と同等のポーズ精度(79.46 mAP)を達成し、学習の不確実性に対して高いロバスト性を示した。
  • 確率的ポーズ分布は、対称的で曖昧なオブジェクトにおけるマルチモーダルな方向不確実性を効果的に捉えており、離散的ビン分割や混合モデルよりも AOE メトリクスで優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。