Skip to main content
QUICK REVIEW

[논문 리뷰] Event-Driven Visual-Tactile Sensing and Learning for Robots

Tasbolat Taunyazov, Weicong Sng|arXiv (Cornell University)|2020. 09. 15.
Advanced Memory and Neural Computing참고 문헌 45인용 수 6
한 줄 요약

이 논문은 뉴모르픽 터치 센서(NeuTouch)와 시각-촉각 스파iking 신경망(VT-SNN)을 사용하여 이벤트 기반의 시각-촉각 인식 시스템을 제안한다. 이는 효율적이고 저지연의 로봇 인식을 가능하게 하며, 물체 분류 및 회전 슬립 감지에서 경쟁적인 정확도를 달성한다. 터치 전용 정확도는 최대 91%에 이를 뿐 아니라, 인텔 로이히에서 GPU 대비 1,900배 낮은 전력 소비를 기록하여 지능형 로봇을 위한 확장 가능하고 에너지 효율적인 프레임워크를 입증한다.

ABSTRACT

This work contributes an event-driven visual-tactile perception system, comprising a novel biologically-inspired tactile sensor and multi-modal spike-based learning. Our neuromorphic fingertip tactile sensor, NeuTouch, scales well with the number of taxels thanks to its event-based nature. Likewise, our Visual-Tactile Spiking Neural Network (VT-SNN) enables fast perception when coupled with event sensors. We evaluate our visual-tactile system (using the NeuTouch and Prophesee event camera) on two robot tasks: container classification and rotational slip detection. On both tasks, we observe good accuracies relative to standard deep learning methods. We have made our visual-tactile datasets freely-available to encourage research on multi-modal event-driven robot perception, which we believe is a promising approach towards intelligent power-efficient robot systems.

연구 동기 및 목표

  • 로봇 엔드플레이어를 위한 확장 가능하고 이벤트 기반의 촉각 센싱 시스템을 개발하여 실시간, 저전력 촉각 인식을 가능하게 한다.
  • 동기식 딥 러닝의 한계를 해결하기 위해 생물학적 신경 처리를 모방하는 异상적, 이벤트 기반의 인식 프레임워크를 제안한다.
  • 스파iking 신경망(SNN)을 사용하여 시각 및 촉각 이벤트 데이터를 통합하여 로봇 작업에서 인식 정확도와 속도를 향상시킨다.
  • 물체 분류 및 슬립 감지와 같은 시스템적 실험을 통해 로봇 분야에서 종단 간 이벤트 기반 인식의 실현 가능성을 입증한다.
  • 다중 모odal, 저전력 로봇 인식 분야의 연구를 가속화하기 위해 공개된 첫 번째 이벤트 기반 시각-촉각 데이터셋을 제공한다.

제안 방법

  • 촉각 자극에 비례하는 비동기 스파이크 이벤트를 생성하는 39-타셀 뉴모르픽 손끝 센서인 NeuTouch를 설계 및 제작하여 확장 가능하고 저지연의 촉각 센싱을 실현한다.
  • 프로페시(Prophesee) 이벤트 카메라와 함께 NeuTouch 센서를 통합하여 다중 모달 인식을 위한 비동기 시각 및 촉각 이벤트 스트림을 캡처한다.
  • 시각 및 촉각 스파이크 트레인을 처리하는 시각-촉각 스파이킹 신경망(VT-SNN)을 개발하며, 조기 분류를 장려하기 위해 시간 가중 스파이크 수 손실 함수를 사용한다.
  • 스파이크 기반 역전파를 사용하여 VT-SNN을 훈련시키며, 새로운 손실 함수($\mathcal{L}_{\omega}$)를 도입하여 초기 스파이크에 더 높은 중요도를 할당함으로써 반응 속도를 향상시킨다.
  • 실시간 시뮬레이션 환경에서 지연과 전력 효율성을 비교하기 위해 훈련된 VT-SNN을 GPU(RTX 2080Ti)와 인텔 로이히 뉴모르픽 칩에 모두 배포한다.
  • 실세계 데이터 흐름을 시뮬레이션하기 위해 시간 빈 인퍼런스 프로토콜(1ms 단위)을 사용하여 하드웨어 플랫폼 간 성능을 비교한다.

실험 결과

연구 질문

  • RQ1NeuTouch와 같은 이벤트 기반 촉각 센서가 더 높은 타셀 수로도 저지연 및 저전력 소비를 유지하면서 효과적으로 확장 가능한가?
  • RQ2다중 모달 이벤트 데이터(시각 및 촉각)를 기반으로 훈련된 스파이킹 신경망이 전통적인 인공 신경망(ANN)에 비해 로봇 인식 작업에서 경쟁적 또는 우수한 성능을 달성할 수 있는가?
  • RQ3시간 가중 스파이크 수 손실이 이벤트 기반 인식 시스템의 조기 분류 성능을 향상시키는가?
  • RQ4특히 실시간 로봇 응용 분야에서 전통적인 GPU 기반 추론에 비해 이벤트 기반 인식 시스템이 얼마나 전력 소비를 줄일 수 있는가?
  • RQ5공개된 이벤트 기반 시각-촉각 데이터셋이 다중 모달, 저전력 로봇 인식 분야의 연구를 가속화할 수 있는가?

주요 결과

  • VT-SNN은 시각 및 촉각 모달을 모두 사용할 경우 물체 분류 정확도가 100%에 도달했으며, 가중 스파이크 수 손실($\mathcal{L}_{\omega}$)을 사용한 터치 전용 데이터로는 91%의 정확도를 기록하여 MLP-GRU 베이스라인(87%)을 초월했다.
  • 회전 슬립 감지에서 VT-SNN은 두 모달을 모두 사용할 경우 완벽한 분류 정확도(1.00)를 달성했으며, $\mathcal{L}_{\omega}$를 사용한 터치 전용 정확도는 91%에 이르러 강력한 조기 감지 능력을 입증했다.
  • VT-SNN은 인텔 로이히에서 추론 지연 시간이 1,039.9 μs로 GPU(1,045.6 μs)와 유사한 성능를 보였지만, 전력 소비는 32.3 mW로 GPU의 61,930 mW에 비해 1,900배 낮아졌다.
  • 가중 스파이크 수 손실($\mathcal{L}_{\omega}$)은 조기 분류 성능을 크게 향상시켰으며, 자극 입력 후 첫 0.05초 내에 더 높은 정확도가 관찰되었다.
  • 시스템은 슬립 발생 후 약 0.08초 내로 회전 슬립을 감지했으며, 시각-촉각 스파이크 처리가 약 매 1ms 간격으로 이루어져 실시간 반응성을 확보했다.
  • 저자들은 향후 다중 모달, 이벤트 기반 로봇 공학 연구를 지원하기 위해 RGB 이미지, 프로 prioceptive 데이터, 이벤트 스트림을 포함한 첫 공개된 이벤트 기반 시각-촉각 데이터셋을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.