Skip to main content
QUICK REVIEW

[논문 리뷰] PointNet++ Grasping: Learning An End-to-end Spatial Grasp Generation Algorithm from Sparse Point Clouds

Peiyuan Ni, Wenguang Zhang|arXiv (Cornell University)|2020. 03. 21.
Robot Manipulation and Learning참고 문헌 28인용 수 6
한 줄 요약

이 논문은 손잡이 샘플링이나 검색을 거치지 않고 희소 포인트 클라우드에서 직접 6차원 손잡이 자세, 카테고리 및 품질 점수를 예측하는 엔드 투 엔드 딥 러닝 방법 PointNet++ Grasping을 제안한다. PointNet++ 기반 모델에 다중 마스크 손실과 새로운 데이터 생성 파이프라인을 적용하여, GeForce 840M에서 11.6M 파라미터와 102ms 추론 시간으로 신규 물체에서 71.43%의 성공률과 91.60%의 완료률을 달성한다.

ABSTRACT

Grasping for novel objects is important for robot manipulation in unstructured environments. Most of current works require a grasp sampling process to obtain grasp candidates, combined with local feature extractor using deep learning. This pipeline is time-costly, expecially when grasp points are sparse such as at the edge of a bowl. In this paper, we propose an end-to-end approach to directly predict the poses, categories and scores (qualities) of all the grasps. It takes the whole sparse point clouds as the input and requires no sampling or search process. Moreover, to generate training data of multi-object scene, we propose a fast multi-object grasp detection algorithm based on Ferrari Canny metrics. A single-object dataset (79 objects from YCB object set, 23.7k grasps) and a multi-object dataset (20k point clouds with annotations and masks) are generated. A PointNet++ based network combined with multi-mask loss is introduced to deal with different training points. The whole weight size of our network is only about 11.6M, which takes about 102ms for a whole prediction process using a GeForce 840M GPU. Our experiment shows our work get 71.43% success rate and 91.60% completion rate, which performs better than current state-of-art works.

연구 동기 및 목표

  • 로봇 손잡이 파이프라인에서 시간이 많이 소요되는 손잡이 샘플링 및 국소 특징 추출 단계를 제거하기 위해.
  • 원시적인 희소 포인트 클라우드에서 직접 6D 손잡이 자세, 카테고리 및 품질 점수를 엔드 투 엔드로 예측할 수 있도록 하기 위해.
  • Ferrari-Canny 지표에 기반한 빠른 검출 알고리즘을 사용해 실제적인 다중 물체 손잡이 데이터셋을 생성하기 위해.
  • 실시간 로봇 조작에 적합한 경량이고 효율적인 네트워크 아키텍처 개발하기 위해.
  • 실세계 환경에서의 새로운 비구조적 물체에 대한 일반화 능력과 성능 향상시키기 위해.

제안 방법

  • 모델은 손잡이 샘플링이나 검색 단계 없이 전체 희소 포인트 클라우드를 엔드 투 엔드로 처리하기 위해 PointNet++ 기반 모델을 활용한다.
  • 손잡이 예측의 각 부분을 보조하기 위해 다중 마스크 손실을 도입하여 국소화 정확도를 향상시킨다.
  • Ferrari-Canny 지표에 기반한 빠른 다중 물체 손잡이 검출 알고리즘을 사용해 마스크와 주석이 포함된 합성 훈련 데이터를 생성한다.
  • 모델은 단일 물체 데이터셋(79개 YCB 물체, 23.7만 개 손잡이)과 다중 물체 데이터셋(마스크가 포함된 2만 개 포인트 클라우드)에서 훈련된다.
  • 모델은 한 번의 순방향 전파로 6D 자세(3D 위치, 3D 방향), 손잡이 카테고리 및 품질 점수 예측을 수행한다.
  • 전체 네트워크는 오직 11.6M 파라미터를 가지며, GeForce 840M GPU에서 약 102ms의 추론 시간을 기록한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 딥 러닝 모델이 기존의 손잡이 샘플링 및 특징 추출 단계를 생략하고 희소 포인트 클라우드에서 직접 6D 손잡이 자세를 예측할 수 있는가?
  • RQ2다중 마스크 손실이 포인트 클라우드 기반 손잡이 예측에서 국소화 정확도와 품질 예측에 얼마나 효과적인가?
  • RQ3빠르고 지표 기반의 데이터 생성 파이프라인은 복잡한 다중 물체 시나리오를 위한 현실적인 합성 환경을 생성할 수 있는가?
  • RQ4현재 최고 수준의 방법과 비교해 제안된 방법이 새로운 물체에서 성공률 및 완료률 측면에서 어떤 성능을 보이는가?
  • RQ5실시간 로봇 구현을 위한 추론 시간과 모델 크기 측면에서 모델의 효율성은 어떠한가?

주요 결과

  • 모델은 새로운 물체 손잡이에서 71.43%의 성공률을 달성하여 현재 최고 수준의 방법을 초월한다.
  • 모델은 91.60%의 완료률을 기록하여 유효한 손잡이 후보를 생성하는 데 높은 신뢰성을 보여준다.
  • GeForce 840M GPU에서 포인트 클라우드당 추론 시간이 오직 102ms로 실시간 적용 가능성을 입증한다.
  • 11.6M 파라미터의 매우 작고 효율적인 모델 크기 덕분에 자원 제약이 있는 플랫폼에서도 효과적인 배포가 가능하다.
  • 다중 마스크 손실의 사용은 손잡이 국소화 및 품질 예측 정확도를 크게 향상시킨다.
  • 합성 데이터 생성 파이프라인 덕분에 정확한 주석이 포함된 복잡한 다중 물체 시나리오에서 효과적인 훈련이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.