Skip to main content
QUICK REVIEW

[논문 리뷰] PRED18: Dataset and Further Experiments with DAVIS Event Camera in Predator-Prey Robot Chasing

Diederik Paul Moeys, Daniel Neil|arXiv (Cornell University)|2018. 07. 02.
CCD and CMOS Imaging Sensors인용 수 8
한 줄 요약

이 논문은 실시간 적으로 고양이-쥐 로봇 추격을 위한 DAVIS 이벤트 카메라를 사용하는 새로운 데이터셋 PRED18과 로봇 시스템을 소개한다. 동적 시각 센서(DVS) 이벤트와 1.25시간의 레이블링된 데이터로 훈련된 CNN을 활용하여, 시스템은 변동 가능한 지연 시간과 에너지 효율성을 달성하며, 추론 중에 사냥개의 각도 위치를 평균 8.7% 오차로 추정한다. 이는 전통적인 딥러닝 프레임워크와의 호환성과 강건성을 입증한다.

ABSTRACT

Machine vision systems using convolutional neural networks (CNNs) for robotic applications are increasingly being developed. Conventional vision CNNs are driven by camera frames at constant sample rate, thus achieving a fixed latency and power consumption tradeoff. This paper describes further work on the first experiments of a closed-loop robotic system integrating a CNN together with a Dynamic and Active Pixel Vision Sensor (DAVIS) in a predator/prey scenario. The DAVIS, mounted on the predator Summit XL robot, produces frames at a fixed 15 Hz frame-rate and Dynamic Vision Sensor (DVS) histograms containing 5k ON and OFF events at a variable frame-rate ranging from 15-500 Hz depending on the robot speeds. In contrast to conventional frame-based systems, the latency and processing cost depends on the rate of change of the image. The CNN is trained offline on the 1.25h labeled dataset to recognize the position and size of the prey robot, in the field of view of the predator. During inference, combining the ten output classes of the CNN allows extracting the analog position vector of the prey relative to the predator with a mean 8.7% error in angular estimation. The system is compatible with conventional deep learning technology, but achieves a variable latency-power tradeoff that adapts automatically to the dynamics. Finally, investigations on the robustness of the algorithm, a human performance comparison and a deconvolution analysis are also explored.

연구 동기 및 목표

  • 이벤트 기반 감지를 활용하여 적응형 지연 시간과 전력 소비를 구현하는 실시간 로봇 시각 시스템을 개발한다.
  • DAVIS 이벤트 카메라를 사용하여 동적인 고양이-쥐 상호작용을 촬영한 대규모 레이블링 데이터셋(PRED18)을 구축한다.
  • 폐쇄형 로봇 제어 환경에서 DVS 이벤트와 프레임 기반 데이터를 활용한 CNN 기반 객체 위치 추정 시스템의 성능을 평가한다.
  • 다양한 운동 역학 조건 하에서 알고리즘의 강건성과 인간 운용자와의 성능 비교를 분석한다.

제안 방법

  • Summit XL 사냥개 로봇에 DAVIS 240C 이벤트 카메라를 장착하여, 운동에 따라 변동 가능한 속도(15–500 Hz)로 이벤트를 기록하고 동시에 표준 15 Hz 프레임도 촬영한다.
  • 1.25시간의 레이블링된 데이터셋을 오프라인으로 사용해 컨volutional 신경망(CNN)을 훈련하여, 시야 내의 사냥개 로봇의 위치와 크기를 분류한다.
  • 추론 과정에서 CNN의 10개 출력 클래스를 조합하여 사냥개 대비 사냥개의 연속적인 각도 위치 벡터를 추정한다.
  • DVS 이벤트 히스토그램과 프레임 데이터를 통합하여, 장면의 동적 특성에 따라 적응하는 변동 지연 처리를 실현하고, 저운동 기간 동안 전력 소비를 감소시킨다.
  • 특징 맵의 해석과 네트워크의 해석 가능성 평가를 위해 탈컨volution 분석을 적용한다.
  • 시스템의 강건성과 실시간 효과성을 평가하기 위해 인간 운용자와의 성능 비교를 실시한다.

실험 결과

연구 질문

  • RQ1DAVIS 이벤트 카메라는 동적인 고양이-쥐 로봇 시나리오에서 실시간, 저지연, 저에너지 소비의 객체 추적을 가능하게 하는가?
  • RQ2하이브리드 프레임 및 이벤트 데이터로 훈련된 CNN의 성능은 실제 세계의 로봇 추격 작업에서 인간 운용자와 비교해 어떻게 되는가?
  • RQ3시스템의 변동 지연 및 전력 소비는 운동 역학의 변화에 얼마나 잘 적응하는가?
  • RQ4다양한 조도 및 운동 조건에서 CNN 기반 각도 추정의 강건성은 어느 정도인가?
  • RQ5탈컨volution 분석을 통해 이벤트 기반 시각 시스템에서의 특징 학습에 대해 어떤 통찰을 얻을 수 있는가?

주요 결과

  • CNN 기반 시스템은 실시간 추론 중에 사냥개 대비 사냥개의 위치를 평균 8.7% 오차로 추정한다.
  • 시스템은 장면의 동적 특성에 따라 변동 가능한 지연 시간과 전력 소비를 보이며, 저운동 단계에서 에너지 소비를 감소시킨다.
  • 인간 운용자와의 비교 결과, 시스템의 추적 정확도는 동일한 작업에서 인간 운용자 수준의 성능을 보인다.
  • 탈컨volution 분석 결과, 네트워크는 물체의 운동과 위치에 대응하는 공간적으로 일관된 특징을 학습하는 것으로 나타났다.
  • 전통적인 CNN에 DVS 이벤트 히스토그램을 통합함으로써 정확도를 유지하면서도 강력하고 저지연의 인식 성능을 달성한다.
  • 1.25시간의 레이블링된 데이터를 포함한 PRED18 데이터셋은 이벤트 기반 로봇 시각 연구에 유의미한 기준이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.