Skip to main content
QUICK REVIEW

[論文レビュー] PointNet++ Grasping: Learning An End-to-end Spatial Grasp Generation Algorithm from Sparse Point Clouds

Peiyuan Ni, Wenguang Zhang|arXiv (Cornell University)|Mar 21, 2020
Robot Manipulation and Learning参考文献 28被引用数 6
ひとこと要約

この論文は、 grasping サンプリング や検索を経ずに、スパースな点群から直接6次元のグリップポーズ、カテゴリ、品質スコアを予測するエンド・ツー・エンドのディーブラーニング手法、PointNet++ Grasping を提案する。PointNet++ バックボーンとマルチマスク損失、および新しいデータ生成パイプラインを用いて、GeForce 840M で102msの推論時間、1160万パラメータで、新規オブジェクトに対して71.43%の成功率と91.60%の完了率を達成し、最先端の手法を上回る性能を発揮する。

ABSTRACT

Grasping for novel objects is important for robot manipulation in unstructured environments. Most of current works require a grasp sampling process to obtain grasp candidates, combined with local feature extractor using deep learning. This pipeline is time-costly, expecially when grasp points are sparse such as at the edge of a bowl. In this paper, we propose an end-to-end approach to directly predict the poses, categories and scores (qualities) of all the grasps. It takes the whole sparse point clouds as the input and requires no sampling or search process. Moreover, to generate training data of multi-object scene, we propose a fast multi-object grasp detection algorithm based on Ferrari Canny metrics. A single-object dataset (79 objects from YCB object set, 23.7k grasps) and a multi-object dataset (20k point clouds with annotations and masks) are generated. A PointNet++ based network combined with multi-mask loss is introduced to deal with different training points. The whole weight size of our network is only about 11.6M, which takes about 102ms for a whole prediction process using a GeForce 840M GPU. Our experiment shows our work get 71.43% success rate and 91.60% completion rate, which performs better than current state-of-art works.

研究の動機と目的

  • ロボットグリッピングパイプラインにおける時間のかかるグリップサンプリングや局所特徴抽出の必要性を排除すること。
  • 生のスパースな点群から直接、6次元グリップポーズ、カテゴリ、品質スコアをエンド・ツー・エンドで予測すること。
  • Ferrari-Canny メトリクスに基づく高速な検出アルゴリズムを用いて、現実的なマルチオブジェクトグリップデータセットを生成すること。
  • リアルタイムのロボット操作に適した軽量で効率的なネットワークアーキテクチャの開発。
  • 現実世界の新規で非構造的なオブジェクトにおいて、一般化性能と性能を向上させること。

提案手法

  • 本手法は、点群のサンプリングや検索ステップを一切行わず、エンド・ツー・エンドで全スパース点群を処理するPointNet++バックボーンを採用する。
  • グリップ予測の異なる部分を監視するためにマルチマスク損失を導入し、局所化の正確性を向上させる。
  • Ferrari-Canny メトリクスに基づく高速なマルチオブジェクトグリップ検出アルゴリズムを用いて、マスクとアノテーション付きの合成学習データを生成する。
  • ネットワークは単一オブジェクトデータセット(79個のYCBオブジェクト、23.7k件のグリップ)とマルチオブジェクトデータセット(マスク付き2万点群)で訓練される。
  • モデルは1回の順伝播でグリップ候補を6次元ポーズ(3次元位置、3次元方向)、グリップカテゴリ、品質スコアとして予測する。
  • 全ネットワークはたった1160万パラメータであり、GeForce 840M GPUで約102msの推論時間を実現する。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドのディーブラーニングモデルは、従来のグリップサンプリングや特徴抽出ステップを回避し、スパースな点群から直接6次元グリップポーズを予測できるか?
  • RQ2マルチマスク損失は、点群ベースのグリッピングにおけるグリップ局所化と品質予測の正確性を向上させるのにどの程度有効か?
  • RQ3高速でメトリクスに基づくデータ生成パイプラインは、実際のマルチオブジェクトシーンを生成し、頑健なグリッピングネットワークの学習に有効か?
  • RQ4提案手法は、最先端手法と比較して、新規オブジェクトにおける成功率と完了率の観点でどの程度の性能を示すか?
  • RQ5リアルタイムのロボットデプロイメントに適した推論時間とモデルサイズにおいて、モデルの効率性はどの程度か?

主な発見

  • 本モデルは新規オブジェクトグリッピングで71.43%の成功率を達成し、現在の最先端手法を上回る性能を示した。
  • 本手法は91.60%の完了率に達しており、有効なグリップ候補を生成する信頼性の高さを示している。
  • GeForce 840M GPU上で1点群あたり102msの推論時間であり、リアルタイム実行の可能性を示している。
  • 1160万パラメータというコンactなモデルサイズのおかげで、リソース制限のあるプラットフォームへの効率的デプロイが可能である。
  • マルチマスク損失の使用により、グリップの局所化と品質予測の正確性が顕著に向上した。
  • 合成データ生成パイプラインにより、正確なアノテーション付きで複雑なマルチオブジェクトシーンの効果的学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。