Skip to main content
QUICK REVIEW

[論文レビュー] Shape Prior Deformation for Categorical 6D Object Pose and Size Estimation

Meng Tian, Marcelo H. Ang|arXiv (Cornell University)|Jul 16, 2020
Human Pose and Action Recognition参考文献 41被引用数 7
ひとこと要約

本稿では、学習されたカテゴリカル形状事前分布からの変形を明示的にモデル化することで、クラス内形状変動を扱う深層学習手法を提案する。この手法は、潜在空間におけるカテゴリ固有の形状事前分布を学習するための変分オートエンコーダーを用い、予測された変形場を介して完全な3Dオブジェクトモデルを再構築し、高密度な2D-3D対応点を推定することで、正確なポーズとサイズ推定を実現する。合成および実世界のベンチマークにおいて最先端の性能を達成している。

ABSTRACT

We present a novel learning approach to recover the 6D poses and sizes of unseen object instances from an RGB-D image. To handle the intra-class shape variation, we propose a deep network to reconstruct the 3D object model by explicitly modeling the deformation from a pre-learned categorical shape prior. Additionally, our network infers the dense correspondences between the depth observation of the object instance and the reconstructed 3D model to jointly estimate the 6D object pose and size. We design an autoencoder that trains on a collection of object models and compute the mean latent embedding for each category to learn the categorical shape priors. Extensive experiments on both synthetic and real-world datasets demonstrate that our approach significantly outperforms the state of the art. Our code is available at https://github.com/mentian/object-deformnet.

研究の動機と目的

  • 3Dモデルが利用できない未観測のオブジェクトインスタンスに対して、カテゴリ内での6次元オブジェクトポーズとサイズを推定する課題に対処すること。
  • NOCS座標の直接回帰に依存するのではなく、クラス内形状変動を明示的にモデル化すること。
  • オブジェクトモデルの集合からカテゴリカル形状事前分布を学習することで、多様なオブジェクトインスタンスへの一般化を向上させること。
  • 統一された深層ネットワークアーキテクチャを用いて、高密度な対応点と6次元ポーズを同時に推定すること。

提案手法

  • 3Dオブジェクトモデルの集合に対して変分オートエンコーダーを訓練し、各カテゴリの潜在埋め込みを学習する。
  • 各カテゴリの平均潜在埋め込みを計算し、デコードしてカテゴリカル形状事前分布を形成する。これは共有された幾何的特徴を表す。
  • 深層ネットワークが形状事前分布から変形場を予測し、与えられたインスタンスの完全な3Dオブジェクトモデルを再構築する。
  • 観測された深度点群と再構築された3Dモデルとの間で高密度な2D-3D対応点を予測する。
  • Umeyamaアルゴリズムを用いて、推定された対応点から6次元ポーズとメトリックサイズを計算する。
  • 訓練の安定性と一般化性能を向上させるために、変形および対応点予測に正則化損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1カテゴリカル形状事前分布からの変形の明示的モデリングが、未観測オブジェクトインスタンスの6次元ポーズとサイズ推定を改善できるか?
  • RQ2オートエンコーダーの潜在空間における形状事前分布の学習が、カテゴリレベルの6次元ポーズ推定性能に与える影響は何か?
  • RQ3形状再構築と対応点予測を分離することは、NOCS座標の直接回帰よりも優れているか?
  • RQ4形状事前分布の選択(例:平均埋め込み、最近傍点、ランダムサンプリング)の変動に対して、本手法はどれほど頑健か?
  • RQ5変形および対応点予測に対する正則化損失が全体の性能に与える寄与度は何か?

主な発見

  • 提案手法は、合成ベンチマークCAMERA25において93.2のmAPを達成し、ベースライン手法を上回った。
  • より挑戦的な実世界データセットREAL275では、77.3のmAPを達成し、実世界のノイズや変動に対しても強い一般化性能を示した。
  • NOCS座標の直接回帰("Regression"ベースライン)は、5°2cmの閾値において、CAMERA25で-3.1%、REAL275で-5.6%の低いmAPを示し、明示的な形状再構築の利点を確認した。
  • 正則化損失を除去すると、REAL275におけるmAPが5.9%低下し、実世界設定におけるロバスト性の重要性を示した。
  • 平均埋め込み、最近傍点、ランダムサンプリングなど、異なる形状事前分布の構築法に対しても本手法は安定しており、学習された埋め込み事前分布が最も優れた結果をもたらした。
  • 合成データでは形状再構築の品質が実データよりも高いが、観測ノイズが今後の課題として残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。