Skip to main content
QUICK REVIEW

[논문 리뷰] Associating Grasping with Convolutional Neural Network Features.

Li Yang Ku, Erik Learned-Miller|arXiv (Cornell University)|2016. 09. 13.
Robot Manipulation and Learning참고 문헌 22인용 수 3
한 줄 요약

이 논문은 사전 훈련된 특징과 대상 지향 백프로파게이션을 활용하여 CNN 기반 방법을 제안하며, 시각 입력을 로봇 손의 사전 형상 조절로 매핑함으로써 잡을 수 있는 물체의 구조를 국소화한다. CNN 레이어의 계층적 특징의 3차원 위치를 식별함으로써, 혼잡한 환경에서도 효과적인 사전 형상 조절이 가능하며, Robonaut-2에서 포인트 클라우드 기반 방법보다 뛰어난 성능을 보인다.

ABSTRACT

In this work, we provide a solution for pre-shaping a human-like robot hand for grasping based on visual information. Our approach uses convolutional neural networks (CNNs) to define a mapping between images and grasps. Applying CNNs to robotics applications is non-trivial for two reasons. First, collecting enough robot data to train a CNN at the same scale as the models trained in the vision community is extremely difficult. In this work, we demonstrate that by using a pre-trained CNN, a small set of grasping examples is sufficient for generalizing across different objects of similar shapes. Second, the final output of a CNN contains little location information of the observed object, which is essential for the robot to manipulate the object. We take advantage of the hierarchical nature of CNN layers and identify the 3D positions of features that capture the hierarchical support relations between filters in different CNN layers using an approach we call targeted backpropagation. Targeted backpropagation traces the activation of higher level features in a CNN backwards through the network to discover the locations in the observation that were responsible for making them fire, thus localizing important structures that are manipulable in the environment. We show that this approach outperforms approaches without targeted backpropagation in a cluttered scene. We further implement a hierarchical controller that controls fingers and palms based on features located in different layers of the CNN for pre-shaping the robot hand and demonstrate that this approach outperforms a point cloud based approach on a grasping task on Robonaut-2.

연구 동기 및 목표

  • 제한된 실제 세계 훈련 데이터를 사용할 때 다양한 물체 형태로의 로봇 잡기 일반화 문제를 해결하기 위해.
  • 표준 CNN 출력에서 공간 국소화의 부족으로 인해 정밀한 로봇 조작이 방해받는 문제를 극복하기 위해.
  • 공간 국소화 기능을 갖춘 계층적 CNN 특징을 사용하여 인간과 유사한 로봇 손의 효과적인 사전 형상 조절을 가능하게 하기 위해.
  • 기본 방법 대비 혼잡한 환경에서의 잡기 성능 향상을 입증하기 위해.

제안 방법

  • 대규모 로봇 전용 데이터셋이 필요 없이, 사전 훈련된 합성곱 신경망(CNN)을 사용하여 이미지에서 시각적 특징을 추출한다.
  • 고차원 CNN 특징에서의 활성화를 입력 이미지의 공간적 기원으로 추적하기 위해 대상 지향 백프로파게이션을 적용하여 핵심 조작 가능한 구조를 식별한다.
  • 다양한 CNN 레이어의 특징 검출기의 3차원 위치를 식별하여 필터 간의 계층적 지원 관계를 캡처한다.
  • 다양한 CNN 레이어의 특징을 로봇 손의 각 손가락과 팔을 제어하는 데 매핑하는 계층적 제어기를 구축한다.
  • 국소화된 특징 맵을 사용하여 접촉 이전에 로봇 손의 사전 형상 조절을 유도함으로써 물체 기하학과의 정렬을 보장한다.
  • 물체 경계가 모호한 혼잡한 환경에서의 내성 강도를 향상시키기 위해 다중 척도 특징 표현을 활용한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 CNN를 사용할 때, 소수의 잡기 시연만으로 유사한 물체 형태 간의 일반화가 가능할 수 있는가?
  • RQ2로봇 정밀 조작을 가능하게 하기 위해 CNN 특징의 공간 국소화는 어떻게 달성할 수 있는가?
  • RQ3표준 CNN 특징 맵에 비해 대상 지향 백프로파게이션은 혼잡한 환경에서의 잡기 성공률을 향상시키는가?
  • RQ4다층 CNN 특징 기반의 계층적 제어는 포인트 클라우드 기반 접근 방식보다 사전 형상 조절에서 뛰어난 성능을 내는가?
  • RQ5계층적 특징 국소화의 통합은 Robonaut-2와 같은 인간형 로봇에서 잡기 성능을 어떻게 향상시키는가?

주요 결과

  • 소수의 잡기 시범만으로도 효과적인 사전 형상 조절을 달성하여, 유사한 물체 형태 간의 일반화를 입증하였다.
  • 대상 지향 백프로파게이션은 이미지 내에서 관련 물체 구조를 성공적으로 국소화하여 정밀한 손 구성 조절을 가능하게 하였다.
  • 잡기 관련 특징의 공간 인식 향상 덕분에 혼잡한 환경에서 표준 CNN 특징 맵보다 우수한 성능을 보였다.
  • 다층 CNN 특징 기반의 계층적 제어기가 Robonaut-2에서 포인트 클라우드 기반 기준선보다 더 높은 잡기 성공률을 달성하였다.
  • 대상 지향 백프로파게이션을 사용한 사전 훈련된 CNN의 활용은 대규모 로봇 훈련 데이터의 필요성을 줄이면서도 높은 성능을 유지할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.