Skip to main content
QUICK REVIEW

[논문 리뷰] Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding

Yaoxian Song, Penglei Sun|arXiv (Cornell University)|2023. 01. 27.
Robot Manipulation and Learning인용 수 4
한 줄 요약

이 논문은 부분 수준의 기능(annotation)이 포함된 대규모 언어 유도 3D 형상 잡기 데이터셋인 Lang-SHAPE와, 자연어 질의를 3D 부분에 대응시켜 정밀한 로봇 잡기 작업을 수행하는 이중 단계 6-DoF 잡기 탐지 네트워크인 PIONEER를 제안한다. 이 방법은 부분 인식 잡기 작업에서 42.07%의 성공률과 부분 특정 설정에서 52.58%의 성공률을 기록하며, 핵심 지표에서 기준 모델보다 20% 이상 뛰어난 성능을 보이며 강력한 일반화 능력과 실제 환경 적용 가능성임을 입증한다.

ABSTRACT

Robotic grasping is a fundamental ability for a robot to interact with the environment. Current methods focus on how to obtain a stable and reliable grasping pose in object level, while little work has been studied on part (shape)-wise grasping which is related to fine-grained grasping and robotic affordance. Parts can be seen as atomic elements to compose an object, which contains rich semantic knowledge and a strong correlation with affordance. However, lacking a large part-wise 3D robotic dataset limits the development of part representation learning and downstream applications. In this paper, we propose a new large Language-guided SHape grAsPing datasEt (named LangSHAPE) to promote 3D part-level affordance and grasping ability learning. From the perspective of robotic cognition, we design a two-stage fine-grained robotic grasping framework (named LangPartGPD), including a novel 3D part language grounding model and a part-aware grasp pose detection model, in which explicit language input from human or large language models (LLMs) could guide a robot to generate part-level 6-DoF grasping pose with textual explanation. Our method combines the advantages of human-robot collaboration and LLMs' planning ability using explicit language as a symbolic intermediate. To evaluate the effectiveness of our proposed method, we perform 3D part grounding and fine-grained grasp detection experiments on both simulation and physical robot settings, following language instructions across different degrees of textual complexity. Results show our method achieves competitive performance in 3D geometry fine-grained grounding, object affordance inference, and 3D part-aware grasping tasks. Our dataset and code are available on our project website https://sites.google.com/view/lang-shape

연구 동기 및 목표

  • 인간의 언어 지시와 기능을 포함한 대규모, 부분 수준의 3D 로봇 잡기 데이터셋이 부족한 문제를 해결하기 위해.
  • 자연어 질의를 특정 3D 물체 부분에 대응시켜 기능 이해를 향상시킴으로써 정밀한 로봇 잡기 작업을 가능하게 하기 위해.
  • 3D 부분 언어 기반 지도와 부분 인식 잡기 자세 예측을 통합한 새로운 6-DoF 잡기 탐지 모델을 개발하기 위해.
  • 물리적 로봇 시스템을 활용하여 복합 일반화 및 실제 환경 배포 성능을 평가하기 위해.
  • 사전 훈련된 언어 모델과 3D 장면 이해를 통해 고수준 인간의 의도와 저수준 로봇 제어 간 격차를 메우기 위해.

제안 방법

  • 1.85M개의 언어 참조 표현, 35개의 부분 카테고리, 300개 이상의 물체에 걸쳐 6-DoF 잡기 애너테이션을 포함한 대규모 3D 데이터셋인 Lang-SHAPE를 제안한다.
  • 이중 단계 네트워크 설계: 첫 번째로, 점군 내에서 언어로 지목된 부분을 국소화하는 3D 부분 언어 기반 지도 모델; 두 번째로, PointNetGPD 기반의 부분 인식 잡기 탐지 헤드.
  • 완전한 물체 표현을 확보하기 위해 눈-손에 장착된 카메라를 활용한 뷰 기반 스캐닝 정책을 도입한다.
  • 사전 훈련된 언어 모델을 사용해 참조 표현을 인코딩하고, 대조 학습을 통해 3D 부분 특징과 정렬한다.
  • 언어 기반 지도에 따라 유도되는 영역 제약 샘플링 전략을 적용하여 잡기 품질을 향상시키고 실패 사례를 감소시킨다.
  • 눈-손에 장착된 카메라를 갖춘 실제 로봇(Kinova Jaco 7-DoF)에 모델을 구현하여 실제 환경에서의 추론과 잡기 작업을 수행한다.

실험 결과

연구 질문

  • RQ1자연어에 기반한 3D 부분 인식 잡기 탐지 모델이 정밀한 잡기 작업에서 높은 성공률을 달성할 수 있는가?
  • RQ2모델은 새로운 물체-부분 조합과 복합 언어 질의에 대해 얼마나 잘 일반화되는가?
  • RQ3물체 전체 수준의 기준 모델 대비 언어 기반 지도가 기능 추론과 잡기 신뢰성에 얼마나 기여하는가?
  • RQ4인간-로봇 상호작용 환경에서 제안된 방법은 실제 로봇 조작에 얼마나 효과적인가?
  • RQ5사전 훈련된 언어 모델의 통합이 3D 잡기 작업에서 제로샷 또는 피처샷 일반화 능력을 향상시키는가?

주요 결과

  • PIONEER는 Lang-SHAPE 데이터셋에서 부분 수준의 잡기 탐지 작업에서 42.07%의 성공률을 기록하며, 기준 모델(Baseline 3)보다 16.96%포인트 높은 성능을 보였다.
  • 부분 특정 언어 모드에서는 성공률이 52.58%로 상승하여 인간-부분 기반 지도의 유용성을 입증하였다.
  • 모델는 우수한 복합 일반화 능력을 보이며, 새로운 물체-부분 조합에 대해서도 성능 향상을 보여 분포 이탈에 대한 강건성을 입증하였다.
  • 실제 로봇 실험을 통해 제안된 방법이 실제 환경에서 효과적임을 확인하였으며, 본적 및 비본적 물체에 대해 언어 기반 잡기 작업을 성공적으로 수행하였다.
  • 영역 제약로 인해 시도 비용은 약간 증가하지만, 성공률 향상의 이득이 이에 상쇄됨을 확인하였다.
  • 모델는 48.76%의 부분 무관 성공률과 평균 15.53회의 시도 횟수를 기록하여 정확성과 효율성 사이의 균형을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.