Skip to main content
QUICK REVIEW

[論文レビュー] POPE: 6-DoF Promptable Pose Estimation of Any Object, in Any Scene, with One Reference

Zhiwen Fan, Panwang Pan|arXiv (Cornell University)|May 25, 2023
Robot Manipulation and Learning被引用数 4
ひとこと要約

POPEは、事前学習された2次元基盤モデルを用いて、任意のシーンにおける1枚の基準画像と任意のターゲットオブジェクト間の正確な相対姿勢予測を達成するゼロショット6自由度オブジェクトポーズ推定フレームワークを導入する。階層的特徴表現、3次元幾何学的原則、および粗いから細かい段階への最適化パイプラインを組み合わせることで、LINEMODでは中央値ポーズ誤差を52.38%、OnePoseでは50.47%低減し、最小限の監督のもとで、オープンワールド、ゼロショット設定において最先端の耐障害性を示している。

ABSTRACT

Despite the significant progress in six degrees-of-freedom (6DoF) object pose estimation, existing methods have limited applicability in real-world scenarios involving embodied agents and downstream 3D vision tasks. These limitations mainly come from the necessity of 3D models, closed-category detection, and a large number of densely annotated support views. To mitigate this issue, we propose a general paradigm for object pose estimation, called Promptable Object Pose Estimation (POPE). The proposed approach POPE enables zero-shot 6DoF object pose estimation for any target object in any scene, while only a single reference is adopted as the support view. To achieve this, POPE leverages the power of the pre-trained large-scale 2D foundation model, employs a framework with hierarchical feature representation and 3D geometry principles. Moreover, it estimates the relative camera pose between object prompts and the target object in new views, enabling both two-view and multi-view 6DoF pose estimation tasks. Comprehensive experimental results demonstrate that POPE exhibits unrivaled robust performance in zero-shot settings, by achieving a significant reduction in the averaged Median Pose Error by 52.38% and 50.47% on the LINEMOD and OnePose datasets, respectively. We also conduct more challenging testings in causally captured images (see Figure 1), which further demonstrates the robustness of POPE. Project page can be found with https://paulpanwang.github.io/POPE/.

研究の動機と目的

  • 未知のオブジェクトを任意のシーンで3次元モデルや高密度アノテーションを必要とせずに6自由度ポーズ推定することを可能にすること。
  • 閉じたカテゴリ検出、CADモデル、または多数の姿勢付きサポートビューに依存する既存手法の制限を克服すること。
  • 1枚の基準画像のみを用いて、任意のオブジェクトカテゴリに一般化可能なゼロショット、オープンワールドのポーズ推定システムを開発すること。
  • 従来の2次元-2次元マッチングが失敗するような、ごみだらけの、遮蔽された、または自然に撮影されたシーンにおける耐障害性を向上させること。
  • 大規模な2次元基盤モデルのゼロショット一般化能力を活用して、オブジェクト検索とポーズ推定を実現すること。

提案手法

  • POPEは、事前学習された2次元基盤モデルを用いて、新しいビューにおけるオブジェクトのセグメンテーション候補を生成し、カテゴリ制限なしにオープンワールド検出を可能にする。
  • クロスアテンションメカニズムを用いて、基準画像とセグメンテーション候補の間でオブジェクトレベルのマッチングを実行し、未学習のオブジェクトのゼロショット検索を可能にする。
  • 幾何制約を用いて、粗い対応点における2次元-2次元グローバルマッチングにより相対6自由度ポーズを推定し、その後2次元-3次元ローカルマッチングで結果を精緻化する。
  • 粗いから細かい段階への最適化パイプラインにより、重度の遮蔽やごみがある状況下でも2視点以上で正確なポーズ推定が可能になる。
  • 階層的特徴表現と3次元幾何学的事前知識を統合することで、マッチングの安定性とポーズ精度を向上させる。
  • 深度マップや事前アノテーションされた3次元データを必要とせず、2視点およびマルチビューのポーズ推定を両方サポートする。

実験結果

リサーチクエスチョン

  • RQ11枚の基準画像が、オープンワールド、ゼロショット設定下で、任意のオブジェクトの正確な6自由度ポーズ推定を可能にするか?
  • RQ2事前学習された2次元基盤モデルをどのように活用することで、複雑なシーンにおけるゼロショットオブジェクト検索と相対ポーズ推定を実現できるか?
  • RQ3ゼロショット設定において、エンドツーエンドまたは単一段階手法と比較して、粗いから細かい段階の2次元-2次元および2次元-3次元マッチングパイプラインがもたらす性能向上はどの程度か?
  • RQ4ごみだらけの背景、遮蔽、または自然に撮影された画像のような困難な現実世界のシナリオにおいて、この手法の耐障害性はどの程度か?
  • RQ5カテゴリ固有のファインチューニングや3次元モデルを必要とせずに、多様なオブジェクトカテゴリに一般化できるか?

主な発見

  • POPEは、ゼロショット設定下で、LINEMODデータセットでは従来手法比で中央値ポーズ誤差を52.38%低減し、OnePoseデータセットでは50.47%低減した。
  • OnePose++データセットでは、中央値誤差が6.273に達し、次善の手法(LoFTR)の9.012と比較して42.2%の改善を達成した。
  • ゼロショット2視点ポーズ推定において、OnePoseデータセットでは30°の誤差許容範囲で96.2%の精度を達成し、LoFTR(96.3%)とGen6D(89.3%)を大きく上回った。
  • LINEMODデータセットでは15°の誤差許容範囲で91.1%の精度を達成し、LoFTR(91.8%)とGen6D(89.3%)を上回った。
  • POPEは、自然に撮影された画像やごみだらけのシーンにおいても高い精度を維持し、従来手法が失敗する状況でも優れた性能を示した。
  • 多様なテクスチャやオブジェクトタイプを有する複数のベンチマークデータセットにおいて、中央値誤差および15°および30°の精度というすべての指標で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。