Skip to main content
QUICK REVIEW

[논문 리뷰] v2e: From Video Frames to Realistic DVS Events

Yuhuang Hu, Shih‐Chii Liu|Zurich Open Repository and Archive (University of Zurich)|2020. 06. 13.
Advanced Memory and Neural Computing참고 문헌 30인용 수 5
한 줄 요약

이 논문은 동적인 비전 센서(DVS) 이벤트를 영상 프레임에서 생성하는 새로운 도구인 v2e를 소개한다. v2e는 강도에 의존하는 대역폭, 가우시안 임계값 불일치, 시간적 노이즈, 누설 이벤트와 같은 핵심 물리적 비이상성을 모델링함으로써 실제와 유사한 DVS 이벤트를 생성한다. 이 방법은 모델의 일반화 능력을 크게 향상시키며, 합성 이벤트로 훈련했을 때 야간 주행 차량 검출에서 YOLOv3의 강도 기반 훈련 대비 40%의 정확도 향상을 기록한다.

ABSTRACT

To help meet the increasing need for dynamic vision sensor (DVS) event camera data, this paper proposes the v2e toolbox that generates realistic synthetic DVS events from intensity frames. It also clarifies incorrect claims about DVS motion blur and latency characteristics in recent literature. Unlike other toolboxes, v2e includes pixel-level Gaussian event threshold mismatch, finite intensity-dependent bandwidth, and intensity-dependent noise. Realistic DVS events are useful in training networks for uncontrolled lighting conditions. The use of v2e synthetic events is demonstrated in two experiments. The first experiment is object recognition with N-Caltech 101 dataset. Results show that pretraining on various v2e lighting conditions improves generalization when transferred on real DVS data for a ResNet model. The second experiment shows that for night driving, a car detector trained with v2e events shows an average accuracy improvement of 40% compared to the YOLOv3 trained on intensity frames.

연구 동기 및 목표

  • 비제어 조명 조건에서 훈련하기 위한 실제적인 DVS 이벤트 데이터셋의 부족을 해결한다.
  • DVS 카메라가 운동 왜곡이 없고 마이크로초 수준의 지연만을 가진다는 일반적인 오해를 바로잡는다.
  • 실제 세계의 DVS 센서 한계, 특히 저조도 조건에서의 특성을 반영하는 시뮬레이션 도구를 개발한다.
  • 합성 이벤트가 객체 인식 및 검출과 같은 후속 시각 작업의 일반화 능력을 향상시키는 데서의 유용성을 입증한다.
  • 야간 주행 시나리오에서 DVS 기반 모델을 평가하기 위한 새로운 레이블이 부여된 데이터셋, MVSEC-NIGHTL21을 제공한다.

제안 방법

  • 로그형 광수용체 반응과 변화 증폭기 동역학을 포함한 물리 기반 접근 방식으로 DVS 픽셀 동작을 모델링한다.
  • 픽셀 수준의 가우시안 임계값 불일치를 통합하여 픽셀 간 변동성을 시뮬레이션한다.
  • 유한하고 강도에 의존하는 대역폭을 도입하여 저조도 조건에서 느린 반응을 모델링한다.
  • 광자 부족 조건에서 실제 센서 행동을 반영하기 위해 시간적 노이즈와 누설 이벤트를 추가한다.
  • 위의 물리 모델을 적용하여 v2e 도구를 사용해 강도 프레임에서 DVS 이벤트를 합성한다.
  • 합성 및 실제 이벤트 데이터를 사용해 강도 기반 모델에서 이벤트 기반 모델로 지식을 전이하기 위해 네트워크 접합 알고리즘(NGA)을 적용한다.

실험 결과

연구 질문

  • RQ1강도 프레임에서 합성 DVS 이벤트를 어떻게 생성할 수 있으며, 이는 실제 센서의 비이상성을 정확히 반영할 수 있는가?
  • RQ2DVS 카메라가 실세계 조명 조건에서 '운동 왜곡 없음'과 '마이크로초 수준의 지연'이라는 일반적인 주장이 어느 정도 유효한가?
  • RQ3v2e로 생성한 합성 DVS 이벤트를 사전 훈련하면, 실제 DVS 데이터로 파인튜닝할 때 일반화 능력이 향상되는가?
  • RQ4v2e로 생성한 저조도 조건의 합성 이벤트로 훈련하면, 강도 기반 모델 대비 실제 야간 이벤트 데이터에서 더 높은 성능을 내는가?
  • RQ5DVS 센서의 물리적 모델링이 합성 이벤트 스트림의 품질과 현실성에 어떤 영향을 미치는가?

주요 결과

  • v2e로 생성한 합성 이벤트를 사용해 다양한 조명 조건에서 ResNet 모델을 사전 훈련하면, 실제 DVS 데이터로 파인튜닝했을 때 지도 학습 기반 모델과 유사한 정확도를 달성하며 일반화 능력이 향상된다.
  • v2e로 생성한 일광 조건의 합성 이벤트로 훈련한 모델(GN-D1)은 실제 야간 이벤트 데이터에서 평균 정밀도(AP50) 36.41%를 기록했으며, 이는 강도 기반 YOLOv3 모델(25.94 AP50) 대비 40% 향상된 성능이다.
  • 실제 일광 이벤트 데이터의 10%만으로 v2e로 훈련한 모델 GN-D1를 파인튜닝한 결과 AP50가 68.55로 나타났으며, 이는 실제 데이터 10%로 훈련한 기준 모델(47.88 AP50) 대비 43% 높은 성능을 기록했다.
  • v2e로 생성한 합성 야간 이벤트가 YOLOv3보다 성능이 떨어지는 데에는 반직관적인 이유가 있었으며, 이는 v2e의 균일한 운동 왜곡이 실제 야간 장면에서 차량 헤드라이트로 인한 局부적 조명과 일치하지 않기 때문이다.
  • 실제 야간 이벤트 데이터로 훈련한 접합 네트워크 GN-N1은 AP50 29.38을 기록했으며, 이는 이벤트 카메라가 저조도 조건에서 강도 카메라보다 더 견고함을 보여준다.
  • v2e 도구는 강도에 의존하는 대역폭과 시간적 노이즈와 같은 핵심 비이상성을 성공적으로 모델링하여, 이전의 시뮬레이터인 ESIM이나 rpg_vid2e보다 더 현실적인 합성 이벤트 생성을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.