Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging SE(3) Equivariance for Self-Supervised Category-Level Object Pose Estimation

Xiaolong Li, Yijia Weng|arXiv (Cornell University)|Oct 30, 2021
3D Shape Modeling and Analysis参考文献 25被引用数 11
ひとこと要約

本論文は、SE(3)同変性を用いた自己教師ありカテゴリーレベル6次元オブジェクトポーズ推定フレームワークを初めて提案する。教師なし学習により、真値ポーズアノテーション、CADモデル、マルチビュー監督も一切不要である。形状とポーズをSE(3)不変再構成モジュールとSE(3)同変ポーズ推定器によって分離することで、カテゴリーレベルの基準フレームを学習し、ModelNet40およびNOCS-REAL275で最先端の性能を達成。一部の完全教師あり手法と同等の精度を実現した。

ABSTRACT

Category-level object pose estimation aims to find 6D object poses of previously unseen object instances from known categories without access to object CAD models. To reduce the huge amount of pose annotations needed for category-level learning, we propose for the first time a self-supervised learning framework to estimate category-level 6D object pose from single 3D point clouds.During training, our method assumes no ground-truth pose annotations, no CAD models, and no multi-view supervision. The key to our method is to disentangle shape and pose through an invariant shape reconstruction module and an equivariant pose estimation module, empowered by SE(3) equivariant point cloud networks.The invariant shape reconstruction module learns to perform aligned reconstructions, yielding a category-level reference frame without using any annotations. In addition, the equivariant pose estimation module achieves category-level pose estimation accuracy that is comparable to some fully supervised methods. Extensive experiments demonstrate the effectiveness of our approach on both complete and partial depth point clouds from the ModelNet40 benchmark, and on real depth point clouds from the NOCS-REAL 275 dataset. The project page with code and visualizations can be found at: https://dragonlong.github.io/equi-pose.

研究の動機と目的

  • 真値ポーズラベルの高コストなアノテーションを回避するため、カテゴリーレベル6次元オブジェクトポーズ推定のための真値ポーズラベルの必要性を排除すること。
  • CADモデルやマルチビュー監督が利用できない状況においても、自己教師あり学習を可能にするカテゴリーレベルポーズ推定の実現。
  • 何らの監督なしに、自己教師あり形状再構成を通じてカテゴリーレベルの基準フレームを暗黙的に発見すること。
  • 自己教師あり設定において、完全教師あり手法と同等のポーズ推定精度を達成すること。

提案手法

  • 回転・平行移動された部分点群から標準形状を再構成するSE(3)不変ニューラルネットワークを用い、アライメントを通じてカテゴリーレベルの基準フレームを学習する。
  • 6次元オブジェクトポーズを予測するSE(3)同変ネットワークを採用し、再構成形状を入力観測空間に変換する。
  • 予測された再構成を推定ポーズで変換し、入力点群と比較することで一貫性損失を形成する。
  • 形状再構成モジュールはSE(3)変換に対して不変性を保証し、ポーズモジュールは同変性を保証することで、形状とポーズの分離を実現する。
  • 真値ポーズやCADモデルにアクセスできない状況で、単一視点の深度点群のみを用いてエンドツーエンドで訓練する。
  • 再構成の一貫性を通じた自己教師あり学習を活用し、共通のカテゴリーレベル座標空間を学習可能にする。

実験結果

リサーチクエスチョン

  • RQ1真値ポーズアノテーションが一切ない状況でも、自己教師ありフレームワークがカテゴリーレベルの基準フレームを学習可能か?
  • RQ2SE(3)同変性と不変性を効果的に活用することで、自己教師あり設定で形状とポーズを分離可能か?
  • RQ3このような手法が、CADモデルなしで合成および実世界のベンチマークにおいても競争力のあるポーズ推定精度を達成可能か?
  • RQ4同カテゴリの未観測オブジェクトインスタンスへどのように一般化可能か?

主な発見

  • 本手法は、自己教師あり学習のみを用いて、ModelNet40ベンチマークにおけるカテゴリーレベル6次元オブジェクトポーズ推定で最先端の性能を達成した。
  • NOCS-REAL275実世界データセットでは、部分的でノイズの多い深度点群に対しても、正確なポーズ予測を実現した。
  • 異なるオブジェクトインスタンスやポーズにおいても、標準形状の再構成が良好にアライメントされており、一貫性のあるカテゴリーレベル基準フレームの出現を示した。
  • ポーズアノテーションなしで学習したにもかかわらず、一部の完全教師あり手法と同等のポーズ推定精度を達成した。
  • YCB-Videoデータセットにおける自己教師ありインスタンスレベルポーズ推定において、ICP-60を上回り、回転誤差および並進誤差が低かった。
  • 対称的で装飾のあるオブジェクトを含む、新しいインスタンスに対しても、定性的および定量的評価を通じて良好な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。