Skip to main content
QUICK REVIEW

[論文レビュー] Orientation Attentive Robotic Grasp Synthesis with Augmented Grasp Map Representation

Georgia Chalvatzaki, Nikolaos Gkanatsios|arXiv (Cornell University)|Jun 9, 2020
Robot Manipulation and Learning参考文献 51被引用数 10
ひとこと要約

本稿では、方向に敏感なグリップ合成フレームワークORANGEを提案する。この手法は拡張グリップマップを用いて、グリップの方向を離散的なビンに分離し、分類と回帰を統合することでグリップ予測を向上させる。深度画像のみを入力として使用し、ジャッカードデータセットで94.71%の最先端性能を達成しており、二本の手を持つロボットを用いた実世界での検証により、複数の方向にわたる効果的で実現可能なグリップ計画が可能であることが示された。

ABSTRACT

Inherent morphological characteristics in objects may offer a wide range of plausible grasping orientations that obfuscates the visual learning of robotic grasping. Existing grasp generation approaches are cursed to construct discontinuous grasp maps by aggregating annotations for drastically different orientations per grasping point. Moreover, current methods generate grasp candidates across a single direction in the robot's viewpoint, ignoring its feasibility constraints. In this paper, we propose a novel augmented grasp map representation, suitable for pixel-wise synthesis, that locally disentangles grasping orientations by partitioning the angle space into multiple bins. Furthermore, we introduce the ORientation AtteNtive Grasp synthEsis (ORANGE) framework, that jointly addresses classification into orientation bins and angle-value regression. The bin-wise orientation maps further serve as an attention mechanism for areas with higher graspability, i.e. probability of being an actual grasp point. We report new state-of-the-art 94.71% performance on Jacquard, with a simple U-Net using only depth images, outperforming even multi-modal approaches. Subsequent qualitative results with a real bi-manual robot validate ORANGE's effectiveness in generating grasps for multiple orientations, hence allowing planning grasps that are feasible.

研究の動機と目的

  • ロボットグリップにおける曖昧なグリップ方向の課題に対処すること。特に、1つのグリップポイントに対して複数の妥当な方向が存在し、視覚学習モデルに混乱をもたらす問題。
  • 著しく異なる方向にわたるアノテーションを集約することで生じる不連続なグリップマップの限界を克服すること。
  • グリップ生成時にロボットの視点や作業空間制約を考慮することで、現実的で実現可能なグリップ計画を可能にすること。
  • 方向に敏感なアテンション機構を導入することで、グリップ品質の予測精度を向上させること。この機構により、高グリップ可能性領域を強調する。
  • アーキテクチャの変更を必要とせず、任意のCNNベースのグリップ予測器を向上可能なモデルに依存しないフレームワークを開発すること。

提案手法

  • 本稿では、360°の角度空間を離散的なビンに分割する拡張グリップマップ表現を導入し、各ピクセルにおけるグリップ方向の局所的分離を可能にする。
  • 分類と回帰の両方を統合したジョイント学習タスクを定式化する。各ビンに対してグリップ方向を分類するとともに、各ビンごとの連続的な角度値を回帰する。
  • ビンごとの方向マップは、グリップ品質マップ上のアテンション機構として機能し、モデルが高グリップ可能性領域に注目するのを支援する。
  • フレームワークはU-Netベースのアーキテクチャに実装されており、任意のCNNベースのグリップ予測モデルと互換性を持つ。
  • 深度画像とアノテートされたグリップマップを用いて、クロスエントロピー損失によるビン分類とスムーズL1損失による角度回帰を組み合わせた損失関数で、エンドツーエンドに訓練される。
  • ロボットの物理的作業空間内に位置するグリップ候補を選択することで、衝突のない実現可能なグリップを計画可能であり、モバイルマニピュレーターロボットを用いて検証された。

実験結果

リサーチクエスチョン

  • RQ1複雑な形状の物体において、グリップ方向の曖昧さを効果的にモデル化することで、グリップ予測をどのように向上させられるか?
  • RQ2方向空間の離散的ビニングは、連続的回帰のみに比べて、グリップマップの一般化性と連続性を向上させることができるか?
  • RQ3方向に敏感なアテンション機構は、ピクセル単位のグリップ合成において、グリップ品質予測をどの程度向上させるか?
  • RQ4深度画像のみで、モデルに依存しないフレームワークがベンチマークグリップデータセットで最先端性能を達成できるか?
  • RQ5提案手法は、複数の方向にわたる現実世界のロボットグリップにおいて、どの程度効果的に機能するか?

主な発見

  • ORANGEは、深度画像のみを入力として使用し、ジャッカードデータセットで94.71%の最先端性能を達成しており、マルチモーダルでより複雑な手法を上回った。
  • 拡張グリップマップ表現は、1つのグリップポイントに対して複数の妥当な方向を効果的に分離し、学習および推論における曖昧さを低減した。
  • 方向に敏感なアテンション機構により、高グリップ可能性領域に注目することで、グリップ品質予測が向上した。これは定性的および定量的結果によって裏付けられた。
  • TIAGo++ロボットを用いた実世界実験では、グリッパーを用いた場合に84%、5本指ハンドを用いた場合に60%の成功率を達成し、複数の方向にわたる成功したグリップが可能であることが示された。
  • ロボットの物理的作業空間内での効果的なグリップ計画が可能であり、二本の手によるグリップのオープンループ軌道実行が成功したことで実証された。
  • 実験により、カメラがロボットに搭載された状態でも、先行研究の静的カメラセットアップとは異なり、視点の変化に対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。