Skip to main content
QUICK REVIEW

[논문 리뷰] Simultaneous Multi-View Object Recognition and Grasping in Open-Ended Domains

Hamidreza Kasaei, Sha Luo|arXiv (Cornell University)|2021. 06. 03.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 개방형 환경에서 다중 시각 객체 인식과 집기 예측을 동시에 수행하는 증강 메모리가 탑재된 딥 러닝 아키텍처를 제안한다. 뷰어 트랜스포머와 집기 네트워크를 통해 RGB 및 깊이 특징을 융합함으로써 메타-액티브 러닝을 통해 지속적이고 소수의 예시로 새로운 객체 유형을 학습할 수 있으며, 이로 인해 난잡한 환경에서 95%의 인식 정확도와 91%의 집기 성공률를 달성한다.

ABSTRACT

To aid humans in everyday tasks, robots need to know which objects exist in the scene, where they are, and how to grasp and manipulate them in different situations. Therefore, object recognition and grasping are two key functionalities for autonomous robots. Most state-of-the-art approaches treat object recognition and grasping as two separate problems, even though both use visual input. Furthermore, the knowledge of the robot is fixed after the training phase. In such cases, if the robot encounters new object categories, it must be retrained to incorporate new information without catastrophic forgetting. In order to resolve this problem, we propose a deep learning architecture with an augmented memory capacity to handle open-ended object recognition and grasping simultaneously. In particular, our approach takes multi-views of an object as input and jointly estimates pixel-wise grasp configuration as well as a deep scale- and rotation-invariant representation as output. The obtained representation is then used for open-ended object recognition through a meta-active learning technique. We demonstrate the ability of our approach to grasp never-seen-before objects and to rapidly learn new object categories using very few examples on-site in both simulation and real-world settings. A video of these experiments is available online at: https://youtu.be/n9SMpuEkOgk

연구 동기 및 목표

  • 로봇이 새로운 객체 유형을 만날 수 있는 동적인 인간 중심 환경에서 지속적이고 개방형 객체 인식과 집기를 수행하는 도전 과제를 해결한다.
  • 완전 재학습 없이도 증분 지식 습득이 가능한 방식으로 딥 러닝에서의 치명적인 기억 상실 문제를 해결한다.
  • 비전문가 사용자 지도를 통해 현장에서 매우 적은 수의 예시로 새로운 객체 유형을 학습할 수 있도록 한다.
  • 고립된 객체와 난잡한 객체 모두에 대해 안정적인 집기 구성과 척도-회전 불변 객체 표현을 동시에 예측한다.
  • 자원 제약이 있는 로봇 시스템에서 효율적이고 실시간으로 적응할 수 있도록 딥 러닝과 메타-액티브 러닝을 통합한 통합 프레임워크를 개발한다.

제안 방법

  • 객체의 다중 RGB-D 시각을 입력으로 사용하며, RGB 시각은 뷰어 트랜스포머를 통해 질감 특징을 추출한다.
  • 깊이 영상은 최대 엔트로피를 통해 기하학적 특징을 추출하고, 전용 집기 네트워크를 사용해 픽셀 수준의 집기 구성 예측을 수행한다.
  • RGB와 깊이 특징 표현을 결합하여 전역적이고 척도 및 회전에 불변인 객체 표현을 생성한다.
  • 메타-액티브 러닝을 활용해 각 유형당 3~5개의 레이블된 예시만으로도 새로운 객체 유형의 빠른 소수 예시 분류를 가능하게 한다.
  • 합성 데이터셋에서 전체 네트워크를 엔드 투 엔드로 훈련하여 집기 및 인식 성능를 동시에 최적화한다.
  • 전역 표현을 후행되는 개방형 학습 헤드의 입력으로 사용하여 최소한의 기억 상실로 지속적인 카테고리 학습을 지원한다.

실험 결과

연구 질문

  • RQ1단일 딥 러닝 아키텍처가 개방형 실세계 환경에서 정확한 3D 객체 인식과 안정적인 집기 예측을 동시에 수행할 수 있는가?
  • RQ2치명적인 기억 상실 없이, 현장에서 매우 적은 수의 예시로만 새로운 객체 유형을 학습할 수 있는가?
  • RQ3RGB와 깊이 데이터의 다중 시각 융합이 난잡한 환경과 물건 무더기 시나리오에서 얼마나 강건한 성능 향상에 기여하는가?
  • RQ4메타-액티브 러닝을 통해 비전문가 사용자로부터 실시간 로봇 응용 프로그램에서 신속하고 상호작용적인 지식 습득이 가능한가?
  • RQ5제한된 데이터 조건 하에서 기존 최고 수준의 접근법과 비교해 본 논문의 방법은 집기 성공률과 인식 정확도 측면에서 얼마나 우수한가?

주요 결과

  • 제안된 방법은 평균적으로 카테고리당 다섯 개 미만의 훈련 예시로도 새로운 객체 유형에 대해 95%의 인식 정확도를 달성했다.
  • 15개 이상의 객체가 혼잡한 상황에서, 로봇은 실제 실험 10회 중 9회에서 테이블 정리 작업을 성공적으로 완료하여 90%의 성공률를 기록했다.
  • 물건 무더기에서의 집기 작업에서는 시뮬레이션에서 23회 중 25회(92% 성공률)와 실제 실험에서 9회 중 10회(90% 성공률)를 달성했다.
  • 복잡하고 난잡한 환경에서도 시뮬레이션과 실제 환경 모두에서 안정적인 집기 구성 예측 성공률가 91% 이상을 기록했다.
  • 실패 사례의 주요 원인은 도달할 수 없는 객체 위치 또는 다수의 객체를 동시에 잡는 의도치 않은 집기(예: 객체와 그 지지 구조를 동시에 잡는 경우)였다.
  • 객체 중심의 집기 예측과 불변 특징 표현을 통해 시점 변화 및 카메라 자세 변화에 대해 강건한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.