Skip to main content
QUICK REVIEW

[논문 리뷰] Lightweight Convolutional Neural Network with Gaussian-based Grasping Representation for Robotic Grasping Detection

Hu Cao, Guang Chen|arXiv (Cornell University)|2021. 01. 25.
Robot Manipulation and Learning참고 문헌 38인용 수 20
한 줄 요약

이 논문은 효율적인 로봇 그립 감지에 적합한 경량이며 완전 컨볼루션 신경망을 제안한다. 2차원 가우시안 커널을 사용해 그립 신뢰도를 인코딩하고, 다중 척도 특징 추출을 위한 수용장역 블록을 통합하며, 다차원 주의 퓨전을 적용함으로써, 파라미터 수가 467만 개에 불과함에도 불구하고 Cornell 데이터셋에서 98.9%의 정확도와 Jacquard 데이터셋에서 95.6%의 정확도를 달성한다. 이는 기존 방법보다 훨씬 작고 빠르면서도 최신 기술 수준의 성능을 유지한다.

ABSTRACT

The method of deep learning has achieved excellent results in improving the performance of robotic grasping detection. However, the deep learning methods used in general object detection are not suitable for robotic grasping detection. Current modern object detectors are difficult to strike a balance between high accuracy and fast inference speed. In this paper, we present an efficient and robust fully convolutional neural network model to perform robotic grasping pose estimation from an n-channel input image of the real grasping scene. The proposed network is a lightweight generative architecture for grasping detection in one stage. Specifically, a grasping representation based on Gaussian kernel is introduced to encode training samples, which embodies the principle of maximum central point grasping confidence. Meanwhile, to extract multi-scale information and enhance the feature discriminability, a receptive field block (RFB) is assembled to the bottleneck of our grasping detection architecture. Besides, pixel attention and channel attention are combined to automatically learn to focus on fusing context information of varying shapes and sizes by suppressing the noise feature and highlighting the grasping object feature. Extensive experiments on two public grasping datasets, Cornell and Jacquard demonstrate the state-of-the-art performance of our method in balancing accuracy and inference speed. The network is an order of magnitude smaller than other excellent algorithms while achieving better performance with an accuracy of 98.9$\%$ and 95.6$\%$ on the Cornell and Jacquard datasets, respectively.

연구 동기 및 목표

  • 로봇 그립 감지에서 추론 속도와 정확도 사이의 상충 관계를 해결하기 위해.
  • 자원 제약이 있는 로봇 시스템에 실시간 배포에 적합한 경량 단일단계 네트워크를 개발하기 위해.
  • 향상된 특징 추출 및 주의 메커니즘을 통해 혼잡한 환경에서도 특징의 구분 능력과 강건성을 향상시키기 위해.
  • 가우시안 커널 표현을 사용해 최고의 그립 신뢰도를 보이는 중심점을 강조함으로써 그립 품질을 더 효과적으로 인코딩하기 위해.
  • 기존 방법과 비교해 성능을 유지하거나 향상시키면서 네트워크 크기를 줄이기 위해.

제안 방법

  • 2차원 가우시안 커널을 사용해 가장 높은 그립 신뢰도를 보이는 중심점을 강조함으로써 학습 샘플을 인코딩하는 가우시안 기반 그립 표현(GGR)을 도입한다.
  • 다중 척도 특징 추출을 향상시키고 특징의 구분 능력을 향상시키기 위해 수용장역 블록(RFB)을 버티컬 레이어에 통합한다.
  • 픽셀 및 채널 주의를 결합함으로써 노이즈를 억제하고 다양한 형태와 크기의 관련 특징을 강조하는 다차원 주의 퓨전 네트워크(MDAFN)를 구현한다.
  • 특징 재구성 과정에서 정보 손실을 줄이기 위해 디코더 경로에서 저수준 및 고수준 특징을 융합한다.
  • RGB-D 이미지에서 끝에서 끝까지 그립 자세 추정을 위한 완전 컨볼루션 단일단계 아키텍처로 설계된 네트워크이다.
  • 일반화성과 강건성을 평가하기 위해 이미지 기반 및 객체 기반 분할 방식을 사용해 Cornell 및 Jacquard 데이터셋에서 학습한다.

실험 결과

연구 질문

  • RQ1경량 단일단계 완전 컨볼루션 네트워크가 로봇 그립 감지에서 높은 정확도와 빠른 추론 속도를 동시에 달성할 수 있는가?
  • RQ2가우시안 기반 그립 표현은 앵커 기반 또는 키포인트 기반 방법에 비해 그립 신뢰도 모델링을 어떻게 향상시키는가?
  • RQ3수용장역 블록과 다차원 주의 메커니즘의 통합이 특징 표현 및 감지 강건성에 얼마나 기여하는가?
  • RQ4단일 객체 데이터셋에서 학습된 모델이 다중 객체가 혼잡한 환경에 어떻게 일반화되는가?
  • RQ5라벨 겹침과 모델 안정성의 균형을 고려할 때, 가우시안 커널의 최적 스케일 요소는 무엇인가?

주요 결과

  • 제안된 방법은 Cornell 데이터셋에서 98.9%의 그립 감지 정확도와 Jacquard 데이터셋에서 95.6%의 정확도를 달성하여 기존 최신 기술 대비 정확도-속도 균형에서 뛰어난 성능을 보였다.
  • 네트워크 크기는 단지 467만 개의 파라미터이며, Chu 등(216M)과 Pinto & Gupta(60M)와 같은 경쟁 기법들보다 한 차수 작다.
  • 모델은 이미지당 5ms의 실시간 추론 속도를 달성했으며, Lenz(13.5초)와 Morrison(3ms)와 같은 방법들보다 훨씬 빠르며 파라미터 수는 훨씬 적다.
  • 제거 실험 결과, GGR, RFBM, MDAFN의 모든 구성 요소가 성능 향상에 기여하며, 전체 모델이 이미지 기반 분할에서 Cornell에서 최고의 정확도(97.8%)를 기록했다.
  • 혼잡한 환경에서 다수의 객체가 존재하는 상황에서도 잘 일반화되어, 단일 객체 데이터에서 학습된 후에도 그립 자세를 성공적으로 감지했다.
  • 실패 케이스는 주로 작은 크기, 복잡한 형태 또는 가림을 받는 객체에서 관찰되었으며, 이는 데이터셋의 다양성 향상이 강건성 향상에 기여할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.