Skip to main content
QUICK REVIEW

[論文レビュー] FS-Net: Fast Shape-based Network for Category-Level 6D Object Pose Estimation with Decoupled Rotation Mechanism

Wei Chen, Xi Jia|arXiv (Cornell University)|Mar 12, 2021
Robot Manipulation and Learning参考文献 42被引用数 9
ひとこと要約

FS-Netは、モノクローラRGB-D画像を用いて、形状に基づく高速な深層ネットワークを提案し、カテゴリレベルの6次元物体ポーズ推定を実現する。3次元グラフ畳み込みオートエンコーダーを用いて回転不変特徴を学習し、分離された回転メカニズムにより精度と耐障害性を向上させる。合成データを一切使用せず、NOCS-REALで6.3%の精度向上を達成し、20 FPSの推論速度を実現し、最先端の性能を達成した。

ABSTRACT

In this paper, we focus on category-level 6D pose and size estimation from monocular RGB-D image. Previous methods suffer from inefficient category-level pose feature extraction which leads to low accuracy and inference speed. To tackle this problem, we propose a fast shape-based network (FS-Net) with efficient category-level feature extraction for 6D pose estimation. First, we design an orientation aware autoencoder with 3D graph convolution for latent feature extraction. The learned latent feature is insensitive to point shift and object size thanks to the shift and scale-invariance properties of the 3D graph convolution. Then, to efficiently decode category-level rotation information from the latent feature, we propose a novel decoupled rotation mechanism that employs two decoders to complementarily access the rotation information. Meanwhile, we estimate translation and size by two residuals, which are the difference between the mean of object points and ground truth translation, and the difference between the mean size of the category and ground truth size, respectively. Finally, to increase the generalization ability of FS-Net, we propose an online box-cage based 3D deformation mechanism to augment the training data. Extensive experiments on two benchmark datasets show that the proposed method achieves state-of-the-art performance in both category- and instance-level 6D object pose estimation. Especially in category-level pose estimation, without extra synthetic data, our method outperforms existing methods by 6.3% on the NOCS-REAL dataset.

研究の動機と目的

  • 効率の悪い特徴抽出によるカテゴリレベル6次元ポーズ推定の低精度と遅い推論速度の課題に対処する。
  • 色の変動に敏感なRGBベースの手法の限界を、色の変動に頑健な形状特徴に注目することで克服する。
  • 新しい3次元データ拡張戦略を導入することで、限られた学習データ下での一般化性能を向上させる。
  • 円形対称性や軸対称性を扱える回転表現を用いて、対称物体に対する耐障害性の高い推定を実現する。
  • 消費者用GPUハードウェアで20 FPSの推論が可能な高速でリアルタイムなシステムを設計する。

提案手法

  • 深度画像から抽出した点群から、回転に依存するが、シフトおよびスケールに不変な潜在特徴を学習する3次元グラフ畳み込み(3DGC)オートエンコーダーを採用する。
  • 学習済み潜在特徴から回転を推定する2つの補完的なデコーダーを用いた分離された回転メカニズムを導入し、対称性に強い推定を実現する。
  • 残差ネットワークを用いて、平均物体座標/サイズと真値の差分を予測することで、並進とサイズを推定する。
  • リアルな形状変化を模擬するため、オンラインのボックスケージに基づく3次元変形機構を提案し、学習データを拡張する。
  • YOLOv3を用いて2次元物体検出を行い、RGB-D入力から粗い3次元点群を抽出した後、3次元球体クローニングを実行してネットワーク入力とする。
  • ベクトルベースの回転表現を採用し、回転群解析と距離最小化を用いて、2軸対称性やN軸対称性など多様な対称タイプを扱えるように拡張する。

実験結果

リサーチクエスチョン

  • RQ1効率的なカテゴリレベル特徴抽出が可能な形状ベースのネットワークは、従来のRGBまたはRGB-D統合手法を上回る6次元ポーズ推定性能を達成できるか?
  • RQ2分離された回転メカニズムを用いることで、対称物体に起因する回転のあいまいさは効果的に解消できるか?
  • RQ3オンライン3次元データ拡張は、カテゴリレベルポーズ推定における低データ環境下での一般化性能をどの程度向上させるか?
  • RQ43DGCオートエンコーダーは、物体のサイズ変化や点群のシフトに対して不変な特徴を学習できるか?
  • RQ5カテゴリレベル6次元ポーズ推定において、推論速度と精度のトレードオフは何か?リアルタイム性能は達成可能か?

主な発見

  • FS-Netは、合成データを一切使用せず、NOCS-REALデータセットで最先端の性能を達成し、従来手法を6.3%上回った。
  • GTX 1080 Ti GPU上で20 FPSで実行可能であり、リアルタイムロボットアプリケーションに適した高い推論効率を示した。
  • 提案されたオンラインボックスケージ3次元変形機構により、NOCS-REALデータセットでポーズ推定精度が7.7%向上し、限定的な監視下でも一般化性能が向上した。
  • 分離された回転メカニズムにより、円形対称性や軸対称性を持つ対称物体に対しても、回転群解析を用いて回転のあいまいさを効果的に解消できた。
  • 定性的な結果から、FS-NetはShape-Priorよりも色や形状の変化に対してより頑健であり、Shape-Priorが失敗する状況でも正しくポーズを推定できた。
  • 3DGCオートエンコーダーは、点群のシフトやスケール変化に対して不変な潜在特徴を学習でき、クラス内変動に対しても一貫した特徴表現を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。