Skip to main content
QUICK REVIEW

[論文レビュー] Shape Completion Enabled Robotic Grasping

Jacob Varley, Chad DeChant|arXiv (Cornell University)|Sep 27, 2016
Robot Manipulation and Learning参考文献 23被引用数 11
ひとこと要約

本論文では、1枚の2.5次元点群から形状補完を行うロボットグリップ計画のための3次元畳み込みニューラルネットワーク(CNN)ベースのフレームワークを提案する。この手法は0.1秒未塔で遮蔽された物体の幾何を補完可能であり、正確なグリップ計画を可能にする。実世界の実験では93.33%のグリップ成功率を達成し、ベースライン手法を20%上回り、ミラー補完法と比較して関節誤差を18%低減した。

ABSTRACT

This work provides an architecture to enable robotic grasp planning via shape completion. Shape completion is accomplished through the use of a 3D convolutional neural network (CNN). The network is trained on our own new open source dataset of over 440,000 3D exemplars captured from varying viewpoints. At runtime, a 2.5D pointcloud captured from a single point of view is fed into the CNN, which fills in the occluded regions of the scene, allowing grasps to be planned and executed on the completed object. Runtime shape completion is very rapid because most of the computational costs of shape completion are borne during offline training. We explore how the quality of completions vary based on several factors. These include whether or not the object being completed existed in the training data and how many object models were used to train the network. We also look at the ability of the network to generalize to novel objects allowing the system to complete previously unseen objects at runtime. Finally, experimentation is done both in simulation and on actual robotic hardware to explore the relationship between completion quality and the utility of the completed mesh model for grasping.

研究の動機と目的

  • 遮蔽や不完全な3次元センシングによる部分観測下でのロボットグリップ計画の課題に対処すること。
  • 深層学習を用いて単一の視点から3次元物体の高速かつ正確な形状補完を可能とすること。
  • 部分的な点群から完全で高品質なメッシュ再構築を生成することで、グリップ計画の性能を向上させること。
  • 新規かつ未確認の物体に対しても適用可能なスケーラブルで汎用性の高いフレームワークを開発すること。
  • 再現可能性および形状補完に関する今後の研究を支援するため、オープンソースのデータセットとコードベースを提供すること。

提案手法

  • 440,000個の合成された40³ボクセルグリッドペアを、3次元メッシュモデルのレンダリング深度画像から得て、3次元CNNを学習する。
  • 推論時、1枚の2.5次元点群が占有グリッドに変換され、遮蔽領域は空欄としてマークされ、学習済みCNNに供給され、完全な占有グリッドを予測する。
  • CNNの出力をマーチング・キューブスを用いて処理しメッシュを生成し、2番目のCUDA加速済み後処理ステップで観測された点群からの微細なディテールを統合し、高解像度のグリップ用メッシュを生成する。
  • システムはシーンからグリップ可能な物体をセグメンテーションし、個別に処理する。非対象物体を高速に補完することで、混雑したシーンにおける衝突回避を可能にする。
  • フレームワークは、バーレットハンドとステーブリTX60アームを用いたシミュレーションおよび実機ロボットハードウェアで評価された。
  • 学習はオフラインで実施され、推論時にリアルタイムの補完が可能であり、平均して0.1秒未塔の補完時間が達成された。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースの形状補完手法は、ヒューリスティック的または対称的補完手法と比較して、グリップ成功率を顕著に向上させることができるか?
  • RQ2物体がトレーニングデータセットに含まれていたか、または学習に使用されたモデル数に応じて、形状補完の品質はどのように変化するか?
  • RQ3推論時において、新規で未確認の物体にCNNがどの程度一般化できるか?
  • RQ4形状補完の品質と、実世界のロボットシステムにおける実行されたグリップの精度および成功率の相関関係はどの程度か?
  • RQ5混雑したシーンで複数の物体を効率的に補完できるか?また、計画段階で信頼性のある衝突回避を可能にするか?

主な発見

  • 提案手法は実世界の実験で93.33%のグリップ成功率を達成し、ベースライン手法を20%上回った。
  • 計画されたグリップ配置と実行されたグリップ配置の平均関節誤差は7.276°であり、ミラー補完法(8.067°)と比較して18%低減された。
  • CNN推論の平均補完時間は0.1秒未塔であり、後処理済みメッシュは約2.4秒で生成された。
  • 非対象物体の補完により、計画段階で衝突を回避できたことが実証された。特に、形状補完が適用された後でのみ衝突が回避されたシナリオが確認された。
  • 未学習の物体や視点に対しても良好な一般化が確認され、トレーニングデータにない新規物体に対しても高品質な補完が得られた。
  • 440,000個のボクセルグリッドペアと関連コードベースを含むオープンソースデータセットがリリースされ、再現可能性および今後の研究を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。