Skip to main content
QUICK REVIEW

[論文レビュー] MoreFusion: Multi-object Reasoning for 6D Pose Estimation from Volumetric Fusion

Kentaro Wada, Edgar Sucar|arXiv (Cornell University)|Apr 9, 2020
Robotics and Sensor-Based Localization参考文献 30被引用数 12
ひとこと要約

MoreFusionは、RGB-Dデータからのボリュメトリックフュージョンを用いて、非干渉制約を微分可能衝突チェックにより強制することで、複数オブジェクトの6次元姿勢を同時に最適化するリアルタイムな多対象6次元姿勢推定システムを提案する。周囲の占有グリッドとCADモデルのフィッティングを統合することで、YCB-VideoおよびCluttered YCB-Videoで最先端の精度を達成し、ごちゃついたシーンにおけるロボット操作の耐障害性を高める。

ABSTRACT

Robots and other smart devices need efficient object-based scene representations from their on-board vision systems to reason about contact, physics and occlusion. Recognized precise object models will play an important role alongside non-parametric reconstructions of unrecognized structures. We present a system which can estimate the accurate poses of multiple known objects in contact and occlusion from real-time, embodied multi-view vision. Our approach makes 3D object pose proposals from single RGB-D views, accumulates pose estimates and non-parametric occupancy information from multiple views as the camera moves, and performs joint optimization to estimate consistent, non-intersecting poses for multiple objects in contact. We verify the accuracy and robustness of our approach experimentally on 2 object datasets: YCB-Video, and our own challenging Cluttered YCB-Video. We demonstrate a real-time robotics application where a robot arm precisely and orderly disassembles complicated piles of objects, using only on-board RGB-D vision.

研究の動機と目的

  • オンボードのRGB-Dセンサを用いて、ごちゃついた、遮蔽され、接触している状況下の複数の既知オブジェクトの正確でリアルタイムな6次元姿勢推定を可能にすること。
  • 学習されたボリュメトリック占有マップからの空間認識を活用して、オブジェクト同士の相互遮蔽や接触という課題に取り組むこと。
  • 衝突制約を用いて複数オブジェクトの姿勢を同時に最適化することで、単一オブジェクトの深度ベース手法を上回る姿勢推定精度を向上させること。
  • 持続的3次元シーン表現とCADモデルのアライメントを統合することで、耐障害性の高い段階的シーン再構築とロボット計画を実現すること。
  • オンボードビジョンのみを用いて、ごちゃついたオブジェクトの山の知的な分解を実行可能なリアルタイムなロボットシステムを実証すること。

提案手法

  • システムは2次元インスタンスセグメンテーションマスクとRGB-Dデータを統合し、自由空間、占有空間、未知空間を表す32×32×32ボクセル化されたボリュメトリック占有グリッドを生成する。
  • 3次元畳み込みニューラルネットワーク(3D-CNN)ベースの姿勢予測ネットワークは、対象オブジェクトのRGB-Dクロップと周囲の占有グリッドを入力として、初期の6次元姿勢仮説を生成する。
  • 反復的衝突チェック(ICC)は、ボクセル空間内での干渉をペナルティ化することで、微分可能かつ共同で複数オブジェクトの姿勢を最適化する。
  • 姿勢の微調整は、ICCとICPを組み合わせ、衝突解決後の表面レベルの整合性を向上させる。
  • 信頼性の高いアライメントが達成され、干渉が生じない場合、システムは段階的にボリュメトリックオブジェクト表現を高精細なCADモデルに置き換える。
  • 全パイプラインはエンドツーエンド微分可能であり、リアルタイムで実行可能であり、段階的シーン再構築とロボットタスク実行を可能にする。

実験結果

リサーチクエスチョン

  • RQ1RGB-D入力のみを用いて、相互に遮蔽され、接触している状況下の多対象6次元姿勢推定は、どのように改善可能か?
  • RQ2ボリュメトリック占有マップによる周囲の空間認識を組み込むことで、単一オブジェクト手法と比較して、どの程度姿勢推定精度が向上するか?
  • RQ3微分可能衝突チェックを用いることで、干渉を解消し、一貫性を向上させるために複数オブジェクトの姿勢を共同最適化できるか?
  • RQ4CADモデルのフィッティング統合は、ごちゃついた環境下での姿勢推定精度とシーン表現をどの程度向上させるか?
  • RQ5ボリュメトリックフュージョンに基づくリアルタイムで段階的なシステムは、ごちゃついたオブジェクトの山の分解といった複雑なロボット操作タスクを可能にするか?

主な発見

  • MoreFusionはCluttered YCB-Videoデータセットで83.4%のADD(-S)および92.3%のADD-Sを達成し、DenseFusion*をそれぞれ1.7%および0.6%上回った。
  • 周囲の占有情報の組み込みにより性能が向上:占有情報なし(-occ)のMoreFusionでも、3D-CNNアーキテクチャのおかげでDenseFusion*を上回った。
  • ICCとICPの組み合わせが最良の結果をもたらした。特に可視性が低い状況(例:<40%)では、ICCがICP単体では解決できない干渉を解消した。
  • 可視性制限付きサブセット(可視性 < 0.3)では、MoreFusionは63.5%のADD(-S)および85.1%のADD-Sを達成し、DenseFusion*(59.7%および83.8%)を上回った。
  • システムは、遮蔽されているオブジェクトの姿勢を隣接オブジェクトからの空間的制約を用いて推定することで、ごちゃついたシーンにおけるリアルタイムなピックアンドプレースを実現し、遮蔽物を効果的に除去してターゲットオブジェクトを正確に配置した。
  • フルシステムのデモでは、正確なCADアライメントを伴う段階的シーン再構築が実現され、遮蔽されたオブジェクトの姿勢が隣接オブジェクトからの空間的制約を用いて推定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。