Skip to main content
QUICK REVIEW

[論文レビュー] GDRNPP: A Geometry-guided and Fully Learning-based Object Pose Estimator

Liu, Xingyu, Zhang, Ruida|arXiv (Cornell University)|Feb 24, 2021
Robot Manipulation and Learning参考文献 65被引用数 14
ひとこと要約

GDR-Netは、学習された2D-3D対応関係と独自のPatch-PnPsモジュールを用いて、単一のRGB画像から直接ポーズを回帰する、幾何学的ガイダンス付きのエンドツーエンド微分可能な6次元物体ポーズ推定器を提案する。この手法は、LM、LM-O、YCB-Vベンチマークで最先端の精度を達成するとともに、リアルタイム推論を維持しており、直接回帰法および間接的PnPs/RANSACベースの手法を上回っている。

ABSTRACT

6D pose estimation of rigid objects is a long-standing and challenging task in computer vision. Recently, the emergence of deep learning reveals the potential of Convolutional Neural Networks (CNNs) to predict reliable 6D poses. Given that direct pose regression networks currently exhibit suboptimal performance, most methods still resort to traditional techniques to varying degrees. For example, top-performing methods often adopt an indirect strategy by first establishing 2D-3D or 3D-3D correspondences followed by applying the RANSAC-based PnP or Kabsch algorithms, and further employing ICP for refinement. Despite the performance enhancement, the integration of traditional techniques makes the networks time-consuming and not end-to-end trainable. Orthogonal to them, this paper introduces a fully learning-based object pose estimator. In this work, we first perform an in-depth investigation of both direct and indirect methods and propose a simple yet effective Geometry-guided Direct Regression Network (GDRN) to learn the 6D pose from monocular images in an end-to-end manner. Afterwards, we introduce a geometry-guided pose refinement module, enhancing pose accuracy when extra depth data is available. Guided by the predicted coordinate map, we build an end-to-end differentiable architecture that establishes robust and accurate 3D-3D correspondences between the observed and rendered RGB-D images to refine the pose. Our enhanced pose estimation pipeline GDRNPP (GDRN Plus Plus) conquered the leaderboard of the BOP Challenge for two consecutive years, becoming the first to surpass all prior methods that relied on traditional techniques in both accuracy and speed. The code and models are available at https://github.com/shanice-l/gdrnpp_bop2022.

研究の動機と目的

  • 対応関係予測後にPnPs/RANSACに依存する2段階で非微分可能な6次元ポーズ推定パイプラインの限界を解消すること。
  • 密な2D-3D対応関係からの幾何的ガイダンスを統合することで、直接的6次元ポーズ回帰の性能を向上させること。
  • 直接回帰と幾何学ベースの間接的手法の長所を統合した、1つのエンドツーエンド微分可能なフレームワークを構築すること。
  • 自己教師付き学習やその他の微分可能なビジョンパイプラインへの応用を可能にする、微分可能なポーズ予測を可能とすること。

提案手法

  • ネットワークはCNNを用いて単一のRGB画像から特徴量を抽出し、密な2D-3D対応関係を予測する。
  • 2D-3D対応関係から画像に類似した2Dパッチを構築することで、空間的構造を保持し、2次元畳み込み処理を可能にする。
  • 学習可能なPatch-PnPsモジュールを導入し、2Dパッチ内の幾何的特徴量から直接6次元ポーズ(回転と並進)を回帰する。
  • 動的ズームイン(DZI)を活用して検出とポーズ推定を分離することで、耐障害性と推論速度を向上させる。
  • パイプライン全体がエンドツーエンド微分可能であり、ポーズ回帰モジュールを介したバックプロパゲーションが可能である。
  • 対称的物体のための対称的ポーズ損失を採用し、トレーニング時に色の増強を適用して過学習を防ぐ。

実験結果

リサーチクエスチョン

  • RQ1中間的な幾何的表現によってガイダンスされた直接的6次元ポーズ回帰が、幾何学ベースの間接的手法と同等の性能を達成できるか?
  • RQ2PnPs最適化ステップをエンドツーエンドディープラーニングフレームワーク内で微分可能かつ学習可能にするにはどうすればよいか?
  • RQ32D-3D対応関係の空間的構造を2次元畳み込み演算を用いて効果的に活用できるか?
  • RQ4統合的でエンドツーエンド微分可能なアーキテクチャが、純粋な直接回帰法と2段階の間接的手法の両方を上回る性能を示せるか?
  • RQ5YCB-VやLM-Oのような困難なデータセットにおいて、最先端の精度を達成しながらもリアルタイム推論速度を維持できるか?

主な発見

  • GDR-Netは、実データ+合成データで訓練された場合、DeepIMのようなリファインメントベースの手法を上回る、LM-Oデータセットにおける最先端の性能を達成した。
  • YCB-Vデータセットでは、1オブジェクトあたり1つのネットワークで84.4%のADD(-S) AUCと91.6%のADD-S AUCを達成し、リファインメントなしでCosyPose や DeepIM よりも優れた性能を示した。
  • 1つのGPU上で1オブジェクトあたり約22msで実行され、リアルタイム推論の能力を示した。
  • リファインメントなしでも、GDR-Netのシングルモデルアプローチは、YCB-Vにおいてリファインメントベースの最先端手法と同等の結果を達成した。
  • アブレーションスタディにより、Patch-PnPsモジュールと幾何的ガイダンスが標準的な直接回帰法よりも顕著に性能向上をもたらすことが確認された。
  • 検出とポーズ推定の分離に動的ズームイン(DZI)を用いることで、精度にわずかな低下しか生じず、実用的展開における有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。