Skip to main content
QUICK REVIEW

[論文レビュー] Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding

Yaoxian Song, Penglei Sun|arXiv (Cornell University)|Jan 27, 2023
Robot Manipulation and Learning被引用数 4
ひとこと要約

本論文は、部品レベルのアフォーダンスアノテーションを備えた大規模な言語誘導型3次元形状の把持データセットLang-SHAPEと、自然言語クエリを3次元部品にマッピングする2段階の6自由度把持検出ネットワークPIONEERを提案する。本手法は、部品認識把持で42.07%の成功率、部品固有設定で52.58%の成功率を達成し、主な指標でベースラインを20%以上上回り、一般化性能と現実世界での有効性を示している。

ABSTRACT

Robotic grasping is a fundamental ability for a robot to interact with the environment. Current methods focus on how to obtain a stable and reliable grasping pose in object level, while little work has been studied on part (shape)-wise grasping which is related to fine-grained grasping and robotic affordance. Parts can be seen as atomic elements to compose an object, which contains rich semantic knowledge and a strong correlation with affordance. However, lacking a large part-wise 3D robotic dataset limits the development of part representation learning and downstream applications. In this paper, we propose a new large Language-guided SHape grAsPing datasEt (named LangSHAPE) to promote 3D part-level affordance and grasping ability learning. From the perspective of robotic cognition, we design a two-stage fine-grained robotic grasping framework (named LangPartGPD), including a novel 3D part language grounding model and a part-aware grasp pose detection model, in which explicit language input from human or large language models (LLMs) could guide a robot to generate part-level 6-DoF grasping pose with textual explanation. Our method combines the advantages of human-robot collaboration and LLMs' planning ability using explicit language as a symbolic intermediate. To evaluate the effectiveness of our proposed method, we perform 3D part grounding and fine-grained grasp detection experiments on both simulation and physical robot settings, following language instructions across different degrees of textual complexity. Results show our method achieves competitive performance in 3D geometry fine-grained grounding, object affordance inference, and 3D part-aware grasping tasks. Our dataset and code are available on our project website https://sites.google.com/view/lang-shape

研究の動機と目的

  • アフォーダンスと人間の言語指示を統合した大規模で部品レベルの3次元ロボット把持データセットの不足に対処すること。
  • 自然言語クエリを特定の3次元オブジェクト部品にマッピングすることで、より洗練されたアフォーダンス理解を実現し、細分化されたロボット把持を可能にすること。
  • 3次元部品の言語マッピングと部品認識把持姿勢予測を統合した、新しい6自由度の把持検出モデルの開発。
  • 物理的ロボットシステムを用いた現実世界での展開と合成一般化性能の評価。
  • 事前学習済み言語モデルと3次元シーン理解を統合することで、高レベルの人の意図と低レベルのロボット制御のギャップを埋めること。

提案手法

  • 1.85Mの言語参照表現、35の部品カテゴリ、300以上のオブジェクトにわたる6自由度の把持アノテーションを備えた大規模な3次元データセットLang-SHAPEを提案。
  • 2段階のネットワークを設計:第1段階はポイントクラウド内の言語で指定された部品を局所化する3次元部品言語マッピングモデル、第2段階はPointNetGPDに基づく部品認識把持検出ヘッド。
  • 完全なオブジェクト表現を得るためのビジュアルサーボ眼内カメラスキャンポリシーを導入。
  • 事前学習済み言語モデルを用いて参照表現を符号化し、対照学習により3次元部品特徴と一致させる。
  • 言語マッピングに従って誘導される領域制約サンプリング戦略を導入し、把持品質の向上と失敗ケースの削減を実現。
  • 眼内カメラを搭載した実際のロボット(Kinova Jaco 7自由度)にモデルをデプロイし、現実世界での推論と把持を実現。

実験結果

リサーチクエスチョン

  • RQ1自然言語にマッピングされた3次元部品認識把持検出モデルは、細分化された把持タスクで高い成功率を達成できるか?
  • RQ2本モデルは、未観測のオブジェクト-部品コンビネーションや合成言語クエリに対してどの程度一般化できるか?
  • RQ3オブジェクト単位のベースラインと比較して、言語マッピングはアフォーダンス推論と把持信頼性をどの程度向上させるか?
  • RQ4本手法は、人間-ロボットインタラクションを伴う現実世界のロボット操作においてどの程度有効か?
  • RQ5事前学習済み言語モデルの統合は、3次元把持におけるゼロショットまたは少数ショット一般化をどの程度向上させるか?

主な発見

  • PIONEERはLang-SHAPEデータセット上で部品認識把持検出に42.07%の成功率を達成し、ベースライン(Baseline 3)を16.96ポイント上回った。
  • 部品固有の言語モードでは成功率が52.58%に上昇し、明示的な人間-部品マッピングの利点が示された。
  • モデルは強力な合成一般化を示し、未観測のオブジェクト-部品コンビネーションでも性能が向上しており、分布シフトに対して耐性があることが示された。
  • 実機実験により、本手法の現実世界での有効性が確認され、見慣れないオブジェクトに対しても言語誘導型把持が成功した。
  • 領域制約の導入により試行コストはわずかに増加したが、成功率の向上がそのトレードオフを補って十分に上回った。
  • 部品に依存しない成功率は48.76%、平均試行回数は15.53回であり、精度と効率のバランスが取れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。