Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Identify Object Instances by Touch: Tactile Recognition via Multimodal Matching

Justin Lin, Roberto Calandra|arXiv (Cornell University)|2019. 03. 08.
Tactile and Sensory Interactions참고 문헌 23인용 수 6
한 줄 요약

이 논문은 빌드형 및 촉각 센서 데이터(젤사이트 센서에서 유래)를 사용하여 시각과 촉각을 융합한 심층 학습 기반의 다중모달 인스턴스 인식 방법을 제안한다. 로봇은 촉각 센서 데이터와 시각 이미지를 매칭하여 물체 인스턴스를 식별한다. 98개의 물체에 대해 자율적이고 자기지도 학습 기반의 데이터 수집을 통해 모델은 새로운 물체에 대해서도 높은 정확도로 촉각과 시각 관측치를 매칭할 수 있으며, 인간이 동일한 작업을 수행할 때보다 뛰어난 성능을 보인다.

ABSTRACT

Much of the literature on robotic perception focuses on the visual modality. Vision provides a global observation of a scene, making it broadly useful. However, in the domain of robotic manipulation, vision alone can sometimes prove inadequate: in the presence of occlusions or poor lighting, visual object identification might be difficult. The sense of touch can provide robots with an alternative mechanism for recognizing objects. In this paper, we study the problem of touch-based instance recognition. We propose a novel framing of the problem as multi-modal recognition: the goal of our system is to recognize, given a visual and tactile observation, whether or not these observations correspond to the same object. To our knowledge, our work is the first to address this type of multi-modal instance recognition problem on such a large-scale with our analysis spanning 98 different objects. We employ a robot equipped with two GelSight touch sensors, one on each finger, and a self-supervised, autonomous data collection procedure to collect a dataset of tactile observations and images. Our experimental results show that it is possible to accurately recognize object instances by touch alone, including instances of novel objects that were never seen during training. Our learned model outperforms other methods on this complex task, including that of human volunteers.

연구 동기 및 목표

  • 시각 감지가 차폐 또는 불량한 조명 조건으로 인해 신뢰할 수 없을 때 촉각을 통해 물체 인스턴스를 인식하는 데 도전하는 것.
  • 동일한 물체의 촉각 및 시각 관측치 간의 이진 매칭 작업으로 다중모달 인스턴스 인식을 공식화하는 것.
  • 로봇이 자율적으로 물체를 잡고 쌍으로 이루어진 시각 및 촉각 데이터를 기록함으로써 대규모 자기지도 학습 기반의 데이터 수집을 가능하게 하는 것.
  • 촉각 감지만으로도 기존에 본 적 없는 물체를 포함하여 정확하고 일반화 가능한 물체 인스턴스 인식이 가능한지 평가하는 것.
  • 학습된 모델의 성능를 인간 참가자들이 수행한 동일한 촉각-시각 매칭 작업과 비교하는 것.

제안 방법

  • 시스템은 로봇의 집게 끝에 장착된 두 개의 젤사이트 촉각 센서를 사용하여 쟁반에서 물체를 잡는 동안 고해상도 표면 변형 이미지를 캡처한다.
  • 주어진 시각 이미지와 촉각 읽기 쌍이 동일한 물체 인스턴스에 해당하는지 분류하기 위해 컨volutional 신경망(CNN)을 훈련한다.
  • 양성 학습 쌍은 동일한 물체에서 유래한 모든 촉각 읽기 데이터를 해당 물체의 이미지와 연결함으로써 생성되며, 서로 다른 물체 간의 쌍은 모두 부정 예시로 간주된다.
  • 데이터셋은 98종의 다른 물체를 반복적으로 잡는 방식으로 자율적으로 수집되어 인간의 레이블링 없이 자기지도 학습이 가능하도록 한다.
  • 모델 평가에서는 훈련 및 테스트 데이터에 포함된 물체에 대해 소수의 샘플(1개, 5개)을 사용한 분류 작업(K=1,5)을 수행하며, 성능은 테스트 세트에서의 정확도로 측정된다.
  • 인간 기준 성능은 동일한 5개 샘플 분류 작업을 수행한 11명의 참가자들을 대상으로 한 통제된 실험을 통해 수집된다.

실험 결과

연구 질문

  • RQ1시각 관측치와 결합된 촉각 감지만으로 로봇이 물체 인스턴스를 정확하게 인식할 수 있는가?
  • RQ2자기지도 학습 기반 접근법이 훈련 중에 보지 못한 새로운 물체 인스턴스에 얼마나 잘 일반화되는가?
  • RQ3촉각-시각 매칭 작업에서 학습된 딥 러닝 모델의 성능가 인간의 성능와 비교해 볼 때 어떤가?
  • RQ4젤사이트 센서에서 얻은 고해상도 촉각 영상이 시각 데이터와의 신뢰할 수 있는 다중모달 매칭을 가능하게 하는가?
  • RQ5학습 데이터에 포함되지 않은 물체에 대해 모델이 높은 정확도를 유지하는가?

주요 결과

  • 모델은 훈련 중에 보지 못한 새로운 물체에 대해서도 촉각 데이터만으로 랜덤 추측 수준을 훨씬 뛰어난 정확도로 물체 인스턴스를 인식한다.
  • 5개 샘플 분류 작업에서, 훈련 및 테스트 물체 모두에서 높은 정확도를 유지하며, 그림 8의 빨간색 및 파란색 막대는 새로운 인스턴스에 대한 일관된 성능을 보여준다.
  • 모델은 인간 참가자들이 수행한 동일한 5개 샘플 촉각-시각 매칭 작업에서 슈퍼리어한 성능을 보이며, 제한된 데이터에서의 일반화 및 패턴 인식 능력이 뛰어나다는 것을 시사한다.
  • 자기지도 학습 기반의 데이터 수집 절차는 인간의 레이블링 없이 대규모이고 저비용의 데이터 확보를 가능하게 하며, 확장 가능한 모델 훈련을 지원한다.
  • 시스템은 촉각 감지가 심층 학습과 결합될 경우, 차폐 또는 조명 변화와 같은 도전적인 조건에서도 견고하고 일반화 가능한 인스턴스 인식이 가능함을 입증한다.
  • 결과적으로 촉각 감지가 로봇 조작에서 물체 인스턴스 인식의 주요 모odal로 사용될 수 있음을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.