Skip to main content
QUICK REVIEW

[論文レビュー] Generative Category-Level Shape and Pose Estimation with Semantic Primitives

Guanglin Li, Yifeng Li|arXiv (Cornell University)|Oct 3, 2022
Human Pose and Action Recognition被引用数 10
ひとこと要約

本論文は、カテゴリレベルの形状とポーズ推定のための生成的フレームワークを提案する。このフレームワークは、カテゴリ内形状変動をモデル化するための意味的プリミティブと、SIM(3)不変の記述子を用いて形状とポーズ最適化を分離する。任意のポーズにおける潜在形状を繰り返し最適化することで、合成データでのみ学習された場合でも、実世界のベンチマークで最先端の性能を達成する。

ABSTRACT

Empowering autonomous agents with 3D understanding for daily objects is a grand challenge in robotics applications. When exploring in an unknown environment, existing methods for object pose estimation are still not satisfactory due to the diversity of object shapes. In this paper, we propose a novel framework for category-level object shape and pose estimation from a single RGB-D image. To handle the intra-category variation, we adopt a semantic primitive representation that encodes diverse shapes into a unified latent space, which is the key to establish reliable correspondences between observed point clouds and estimated shapes. Then, by using a SIM(3)-invariant shape descriptor, we gracefully decouple the shape and pose of an object, thus supporting latent shape optimization of target objects in arbitrary poses. Extensive experiments show that the proposed method achieves SOTA pose estimation performance and better generalization in the real-world dataset. Code and video are available at https://zju3dv.github.io/gCasp.

研究の動機と目的

  • カテゴリレベルの3次元オブジェクトポーズ推定における大きなカテゴリ内形状変動の課題に対処すること。
  • 形状とポーズ推定を分離することで、より高いロバストネスと最適化の柔軟性を向上させること。
  • 新しい幾何的記述子を用いて、任意のポーズでのオンラインで繰り返し可能な形状最適化を可能にすること。
  • 実世界のデータに強い一般化性能を実現するために、合成データのみで学習した場合でも効果を発揮すること。

提案手法

  • オブジェクト形状を意味的プリミティブ(例:シリンダ型ボディ、ハンドル型部品など)で表現することで、共通の潜在空間に多様な形状を統合する。
  • 共通の潜在コードを共有する2つのオートデコーダ(細部用と意味的プリミティブ用)を備えた生成モデルを用いる。
  • 意味的プリミティブの幾何的分布から導出されるSIM(3)不変の形状記述子を導入し、形状とポーズの最適化を分離する。
  • 記述子を用いて、観測された点群と生成された点群のチャムファーディスタンスを最小化することで、オンラインで潜在形状を最適化する。
  • 最適化された形状の意味的プリミティブと観測されたプリミティブを対応付けるアルゴリズムにより、最終的なオブジェクトポーズを回復する。
  • 入力点群の部分に意味的ラベルを割り当てるパーツセグメンテーションネットワークを用い、プリミティブベースの対応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1意味的プリミティブは、カテゴリ内に多様な形状が存在する場合でも、カテゴリレベルの形状推定において有効に統合できるか?
  • RQ2SIM(3)不変の記述子は、任意のポーズにおいて形状とポーズ最適化を信頼性高く分離可能か?
  • RQ3繰り返し潜在形状最適化は、一回の推論に比べてポーズ推定の精度を向上させるか?
  • RQ4合成データでのみ学習した場合でも、実世界データに十分に一般化できるか?

主な発見

  • 提案手法は、実世界ベンチマークREAL275において、カテゴリレベルのポーズ推定で最先端の性能を達成した。
  • REAL275における形状再構成誤差は、チャムファーディスタンスで3.46×10⁻³にまで低下し、平均形状の場合にSGPA(2.44×10⁻³)を上回った。
  • 最適化された形状を用いることで、ポーズ推定の精度が顕著に向上し、REAL275ではmAPが88.4%に達した(平均形状やランダム形状に比べて)。
  • 意味的プリミティブの数を64から256に増やすことでポーズ精度が向上し、256でピークに達したが、512に達する段階でセグメンテーションノイズにより低下した。
  • 形状記述子に10⁶個のアトム記述子を用いることで、再構成誤差が最小(RANSACを用いた場合3.44×10⁻³)となり、記述子選択に対して高いロバストネスを示した。
  • 実世界データへの一般化性能が高く、実世界のファインチューニングなしで最先端の結果を達成した。ゼロショット一般化の強さを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。