Skip to main content
QUICK REVIEW

[論文レビュー] A Multi-task Convolutional Neural Network for Autonomous Robotic Grasping in Object Stacking Scenes

Hanbo Zhang, Xuguang Lan|arXiv (Cornell University)|Sep 19, 2018
Robot Manipulation and Learning参考文献 22被引用数 6
ひとこと要約

本稿では、複雑なオブジェクト積み重ねシーンにおける自律的ロボット grasping を実現するため、認識、推論、把持実行を統合したマルチタスク畳み込みニューラルネットワークを提案する。オブジェクトと把持を同時に検出することで、視覚的マニピュレーション関係を推論し、把持順序を計画する。RGBと深度入力を用いたBaxterロボットを用いて、ごみくず状態、熟知された状態、複雑な積み重ね状態の各シーンで、それぞれ90.6%、71.9%、59.4%の成功率を達成した。

ABSTRACT

Autonomous robotic grasping plays an important role in intelligent robotics. However, how to help the robot grasp specific objects in object stacking scenes is still an open problem, because there are two main challenges for autonomous robots: (1)it is a comprehensive task to know what and how to grasp; (2)it is hard to deal with the situations in which the target is hidden or covered by other objects. In this paper, we propose a multi-task convolutional neural network for autonomous robotic grasping, which can help the robot find the target, make the plan for grasping and finally grasp the target step by step in object stacking scenes. We integrate vision-based robotic grasping detection and visual manipulation relationship reasoning in one single deep network and build the autonomous robotic grasping system. Experimental results demonstrate that with our model, Baxter robot can autonomously grasp the target with a success rate of 90.6%, 71.9% and 59.4% in object cluttered scenes, familiar stacking scenes and complex stacking scenes respectively.

研究の動機と目的

  • ターゲットが隠されたり覆い隠されたりしている複雑でごみくず状態や遮蔽状態のオブジェクト積み重ねシーンにおける自律的ロボット把持を可能にすること。
  • 順次把持の過程で他のオブジェクトを損傷させないよう、正しい把持順序を推論する課題に対処すること。
  • 視覚ベースのオブジェクト検出、把持候補予測、視覚的マニピュレーション関係推論を1つのディープニューラルネットワークに統合すること。
  • RGB画像入力からロボットの把持制御までエンドツーエンドで実行可能にすること。深度情報は座標変換に使用する。
  • 複数オブジェクト、遮蔽状態、複雑な積み重ね環境において、統合的認識と推論により、既存手法を上回ること。

提案手法

  • 認識(オブジェクト検出と把持候補予測)、推論(視覚的マニピュレーション関係予測)、把持(把持実行計画)の3つの並列ヘッドを備えたマルチタスクCNNアーキテクチャを設計した。
  • 認識ヘッドは、局所化された領域内でオブジェクトとその把持候補を検出し、グローバル画像レベルでの把持検出を回避した。
  • 推論ヘッドは、オブジェクト間の視覚的マニピュレーション関係(例:「~の上に」、「~の下に」)を予測し、正しい把持順序を推論する。
  • RGB入力を推論に、深度データをアプローチベクトルと座標変換の計算に使用することで、把持実行を可能にした。
  • VMRDデータセット上でエンドツーエンドに訓練し、検出、関係予測、把持品質の各損失関数を最適化した。
  • 比較のため、FCGNとVMRNの段階的ベースラインを用い、共同学習の優位性を示した。

実験結果

リサーチクエスチョン

  • RQ11つのディープニューラルネットワークが、複雑なシーンにおけるオブジェクト検出、把持候補予測、視覚的マニピュレーション推論を効果的に統合できるか?
  • RQ2認識と推論の共同学習は、遮蔽またはごみくず状態の積み重ねシーンにおける把持成功率をどのように向上させるか?
  • RQ3本モデルは、オブジェクトのごみくず状態、熟知された積み重ね、複雑な積み重ねといった、さまざまなシーンの複雑さに対してどの程度一般化可能か?
  • RQ4RGBによる認識と推論に依存しながら、深度情報の統合が把持実行に与える影響は何か?
  • RQ5本稿で提案するマルチタスクネットワークは、実際のロボット実験において、段階的ベースラインをどの程度上回るか?

主な発見

  • 提案モデルは、ごみくず状態のシーンで90.6%の成功率を達成し、ベースラインの43.8%を顕著に上回った。
  • 熟知された積み重ね状態では、モデルは71.9%の成功率を達成し、ベースラインの28.1%を上回った。
  • 6〜9個のオブジェクトを含む複雑な積み重ね状態では、モデルは59.4%の成功率を達成し、ベースラインの6.3%を上回った。
  • 失敗要因の分析では、ターゲット検出の信頼度が低い(例:眼鏡)、オブジェクトの重なりによる把持の混同、過大な把持予測が原因であることが判明した。
  • ターゲットが見えなくても、マニピュレーション関係を推論し、可視オブジェクトを順次移動させることで、正しい把持順序を効果的に推論できた。
  • 認識、推論、把持計画を1つのネットワークに統合することで、遮蔽状態や複雑な環境においても、頑健な順次把持が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。