Skip to main content
QUICK REVIEW

[論文レビュー] Category-Level 6D Object Pose Estimation via Cascaded Relation and Recurrent Reconstruction Networks

Jiaze Wang, Kai Chen|arXiv (Cornell University)|Aug 19, 2021
Robot Manipulation and Learning被引用数 7
ひとこと要約

本論文は、RGB画像、点群、およびカテゴリ形状の事前知識を活用してNOCS空間内に標準化された3次元モデルを再構築することを目的とした段階的関係性と再帰的再構築ネットワークを提案する。この手法は最先端の性能を達成し、厳密な$3D_{75}$および$5^\circ2cm$評価基準下で、先行する最先端手法に対してそれぞれ4.9%および17.7%のmAP向上を達成した。

ABSTRACT

Category-level 6D pose estimation, aiming to predict the location and orientation of unseen object instances, is fundamental to many scenarios such as robotic manipulation and augmented reality, yet still remains unsolved. Precisely recovering instance 3D model in the canonical space and accurately matching it with the observation is an essential point when estimating 6D pose for unseen objects. In this paper, we achieve accurate category-level 6D pose estimation via cascaded relation and recurrent reconstruction networks. Specifically, a novel cascaded relation network is dedicated for advanced representation learning to explore the complex and informative relations among instance RGB image, instance point cloud and category shape prior. Furthermore, we design a recurrent reconstruction network for iterative residual refinement to progressively improve the reconstruction and correspondence estimations from coarse to fine. Finally, the instance 6D pose is obtained leveraging the estimated dense correspondences between the instance point cloud and the reconstructed 3D model in the canonical space. We have conducted extensive experiments on two well-acknowledged benchmarks of category-level 6D pose estimation, with significant performance improvement over existing approaches. On the representatively strict evaluation metrics of $3D_{75}$ and $5^{\circ}2 cm$, our method exceeds the latest state-of-the-art SPD by $4.9\%$ and $17.7\%$ on the CAMERA25 dataset, and by $2.7\%$ and $8.5\%$ on the REAL275 dataset. Codes are available at https://wangjiaze.cn/projects/6DPoseEstimation.html.

研究の動機と目的

  • 未学習のオブジェクトインスタンスに対してCADモデルを必要とせずにカテゴリ内での6次元オブジェクトポーズ推定の課題に対処すること。
  • RGB画像、点群、およびカテゴリ事前知識の間の複雑な関係をモデル化することで、NOCS空間内での標準化された3次元モデル再構築を改善すること。
  • 粗くから細かくへと段階的な改善を繰り返すことで、再構築された3次元モデルの精度を向上させ、ポーズ推定の正確性を高めること。
  • カテゴリレベルの6次元ポーズ推定におけるクラス内形状変動および空間的に偏った特徴学習の課題を克服すること。
  • 実世界のロボット操作および拡張現実アプリケーションに耐性のあるフレームワークを構築すること。

提案手法

  • インスタンスのRGB画像と点群の間のクロスモダリティ関係をモデル化するための段階的関係ネットワークを設計し、特徴表現を強化する。
  • インスタンス特徴とカテゴリ形状事前知識の間の関係を捉えるカテゴリ関係ネットワークを導入し、クラス内形状変動をモデル化する。
  • 反復的残差フィードバックを実行する再帰的再構築ネットワークを採用し、NOCS空間内での3次元モデル再構築の精度を段階的に向上させる。
  • 再構築された標準化された3次元モデルを用いて、観測されたインスタンス点群との密な対応関係を確立し、6次元ポーズ推定を実現する。
  • CAMERA25とREAL275を統合したハイブリッドデータセット上で、カテゴリあたり3つのトレーニングインスタンスのみを用いて、エンドツーエンドで学習する。
  • 同一カテゴリのインスタンス間でのスケールと方向の統一を図るため、正規化オブジェクト座標空間(NOCS)を活用する。

実験結果

リサーチクエスチョン

  • RQ1RGB画像と点群の間のクロスモダリティ関係をどのように効果的にモデル化すれば、カテゴリレベルの6次元ポーズ推定の性能が向上するか?
  • RQ2カテゴリレベルの形状事前知識は、クラス内形状変動をどの程度軽減し、標準化された3次元モデル再構築を改善できるか?
  • RQ3再帰的フィードバックによって、粗くから細かくへと段階的な再構築精度の向上が可能となり、結果として6次元ポーズ推定の精度が向上するか?
  • RQ4厳密な評価基準($3D_{75}$および$5^\circ2cm$)下で、本手法は最先端のアプローチと比較してどの程度優れているか?
  • RQ5段階的関係性と再帰的再構築の各モジュールが、全体の性能向上に果たす寄与度はどの程度か?

主な発見

  • CAMERA25ベンチマークにおいて、3D IoU 75%のmAPは55.9%に達し、$3D_{75}$評価基準で先行のSOTA手法SPDを4.9%上回った。
  • 同じデータセットにおいて、$5^\circ2cm$ポーズ誤差評価基準でもmAPがSPDを上回り、17.7%の向上を達成した。
  • REAL275ベンチマークでは、$5^\circ2cm$誤差に対するmAPが27.8%に達し、SPDと比較して8.5%の改善を示した。
  • CAMERA25およびREAL275の両ベンチマークにおいて、再構築されたNOCSモデルのチェンバーディスタンス(CD)は、SPDを常に下回っており、形状再構築の優位性を示している。
  • アブレーションスタディの結果、長距離およびクロスモダリティ関係をモデル化する際、Transformerベースの関係モジュールがMLPおよびNon-Localネットワークを上回ることがわかった。
  • 2ステップの再帰的ステップを用いた場合、CAMERA25では$5^\circ2cm$評価基準でmAPが4.7%向上し、REAL275では4.0%向上した。これは段階的フィードバックによる改善の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。