Skip to main content
QUICK REVIEW

[논문 리뷰] EventSR: From Asynchronous Events to Image Reconstruction, Restoration, and Super-Resolution via End-to-End Adversarial Learning

Lin Wang, Tae‐Kyun Kim|arXiv (Cornell University)|2020. 03. 17.
Advanced MRI Techniques and Applications참고 문헌 54인용 수 9
한 줄 요약

EventSR는 지도 학습이 필요 없는 종단 간 적대적 학습 프레임워크를 제안하며, 지도 학습이 필요한 고해상도(HR), 고다이나믹 레인지(HDR), 운동 흐림이 없는 강도 이미지를 저해상도(LR) 비동기 이벤트 스트림에서 직접 복원한다. 기존의 지도 학습이 필요한 고해상도 이미지나 다운샘플링 커널이 필요로 하지 않는다. 이 방법은 단계별로 순차적으로 수행되는 세 가지 작업—저해상도 이미지 복원, 이미지 복원(노이즈 제거/흐림 제거), 초해상도 처리—을 수행하며, 적대적 손실과 인지적 손실을 활용한 단계별 훈련 전략을 사용하여 시뮬레이션 및 실제 데이터에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Event cameras sense intensity changes and have many advantages over conventional cameras. To take advantage of event cameras, some methods have been proposed to reconstruct intensity images from event streams. However, the outputs are still in low resolution (LR), noisy, and unrealistic. The low-quality outputs stem broader applications of event cameras, where high spatial resolution (HR) is needed as well as high temporal resolution, dynamic range, and no motion blur. We consider the problem of reconstructing and super-resolving intensity images from LR events, when no ground truth (GT) HR images and down-sampling kernels are available. To tackle the challenges, we propose a novel end-to-end pipeline that reconstructs LR images from event streams, enhances the image qualities and upsamples the enhanced images, called EventSR. For the absence of real GT images, our method is primarily unsupervised, deploying adversarial learning. To train EventSR, we create an open dataset including both real-world and simulated scenes. The use of both datasets boosts up the network performance, and the network architectures and various loss functions in each phase help improve the image qualities. The whole pipeline is trained in three phases. While each phase is mainly for one of the three tasks, the networks in earlier phases are fine-tuned by respective loss functions in an end-to-end manner. Experimental results show that EventSR reconstructs high-quality SR images from events for both simulated and real-world data.

연구 동기 및 목표

  • 지침 학습이 필요한 고해상도(HR) 이미지나 손상 모델이 없는 상황에서 저해상도(LR) 이벤트 스트림으로부터 고품질의 고해상도 강도 이미지를 복원하는 문제를 해결하기 위해.
  • 이벤트 스트림 누적과 센서 한계로 인해 기존 방법들이 노이즈가 많거나 흐릿하거나 저품질의 복원 결과를 내는 데서 비롯되는 한계를 극복하기 위해.
  • 이미지 복원, 복원, 초해상도 처리를 하나의 프레임워크에 통합한 종단 간 통합 파이프라인을 개발하여 비지도 학습 방식으로 훈련하는 것.
  • 적대적 학습과 새로운 데이터셋(실제 세계 데이터와 시뮬레이션 데이터의 조합)을 활용하여 복원된 이미지의 시각적 정확성과 인지적 품질을 향상시키기 위해.
  • 고공간 해상도, HDR, 운동 흐림이 없는 영상이 요구되는 응용 분야에서 이벤트 카메라의 실용적 활용을 가능하게 하기 위해.

제안 방법

  • EventSR는 세 단계 종단 간 파이프라인을 사용한다: (1) 이벤트 스트림에서 저해상도 강도 이미지를 복원하고, (2) 현실적인, 흐림이 제거된 저해상도 이미지를 복원하며, (3) 복원된 이미지를 확대 인자 ×4를 사용하여 고해상도로 초해상도 처리한다.
  • 각 단계에 대해 별도의 생성적 적대적 네트워크(GAN) 아키텍처를 사용하며, 생성자(generator)와 판별자(discriminator)를 별도로 설계하여 인지적 품질 향상을 위한 적대적 학습을 가능하게 한다.
  • 각 단계에서 적대적 손실($\mathcal{L}_{Adv}^{r}, \mathcal{L}_{Adv}^{d}, \mathcal{L}_{Adv}^{s}$)과 인지적 유사도 손실($\mathcal{L}_{Sim}^{r}, \mathcal{L}_{Sim}^{d}, \mathcal{L}_{Sim}^{s}$)을 적용하여 현실성과 세부 사항 향상을 도모한다.
  • 단계 간 훈련 전략을 통해 후속 단계의 손실이 이전 네트워크로 역전파되도록 하여 모든 단계에서 공동 최적화 및 향상된 특징 학습을 가능하게 한다.
  • 일관된 일반화 능력을 향상시키기 위해 시뮬레이션 이벤트, 실제 세계 이벤트 데이터, RGB 초해상도 데이터셋을 조합한 11만 장의 이미지로 구성된 새로운 오픈 소스 데이터셋을 사용하여 훈련한다.
  • 이벤트 스트림은 시공간 이벤트 스택 표현 방식으로 임bedding되며, L1 손실, 인지적 손실, 적대적 손실의 조합을 통해 최적화되어 정확성과 현실감을 균형 있게 확보한다.
Figure 1: Reconstructing realistic HDR SR intensity image from pure events. EventSR reconstructs LR HDR intensity image, restores realistic LR image and finally generates SR image (with scale factor of $\times 4$ ) from events in phase 1,2 and 3, respectively.
Figure 1: Reconstructing realistic HDR SR intensity image from pure events. EventSR reconstructs LR HDR intensity image, restores realistic LR image and finally generates SR image (with scale factor of $\times 4$ ) from events in phase 1,2 and 3, respectively.

실험 결과

연구 질문

  • RQ1지침 학습이 필요한 고해상도(HR) 이미지가 없이도 저해상도 이벤트 스트림에서 고해상도, 고다이나믹 레인지, 운동 흐림이 없는 강도 이미지를 복원할 수 있는가?
  • RQ2노이즈가 많고 흐릿한 이벤트 데이터에서 복원된 이미지의 현실성과 품질을 향상시키기 위해 적대적 손실과 인지적 손실을 효과적으로 어떻게 통합할 수 있는가?
  • RQ3시뮬레이션 데이터와 실제 세계 데이터를 하나의 훈련 파이프라인에 통합할 경우, 이벤트 기반 이미지 복원 및 초해상도 처리에 어떤 영향을 미치는가?
  • RQ4기존의 블러 제거 및 초해상도 처리 네트워크를 단순히 연결한 나열적 파이프라인보다, 세 단계 종단 간 프레임워크가 이벤트 데이터에 적용되었을 때 성능이 뛰어나게 되는가?
  • RQ5다단계 손실 역전파를 포함한 단계별 훈련 전략은 각 단계를 별도로 훈련하는 것보다 전체 성능을 어떻게 향상시키는가?

주요 결과

  • EventSR는 지도 학습이 필요한 고해상도 이미지가 없는 상황에서도 이벤트 스트림에서 고품질 초해상도 이미지를 복원하는 데 있어 최신 기술 수준의 성능을 달성하며, Tao 등 [18]과 Pan 등 [30]의 기존 방법보다 블러 제거 및 이미지 복원 성능에서 뛰어나다.
  • 제거 실험 결과, 적대적 손실($\mathcal{L}_{Adv}^{r}, \mathcal{L}_{Adv}^{d}, \mathcal{L}_{Adv}^{s}$)이나 인지적 손실을 제거할 경우 이미지 품질 저하, 훈련 불안정성, 노이즈 증가가 발생함을 확인하여 이 손실 항목들이 필수적임을 입증한다.
  • 훈련 데이터셋에서 시뮬레이션 데이터와 실제 세계 데이터를 모두 활용할 경우 네트워크의 일반화 능력과 성능 향상이著격하게 향상되며, 특히 제2단계와 제3단계에서 두드러진다.
  • 지침 학습이 필요한 고해상도 이미지가 없더라도 프레임워크는 현실적이고 선명하며 세밀한 고해상도 이미지를 성공적으로 복원하여 비지도 적대적 학습의 효과성을 입증한다.
  • NVIDIA 1080 Ti GPU에서 추론 시간은 약 300–500ms per 이미지이며, 약 1700만 개의 파rameter를 가지므로 실시간 응용에 계산적으로 실현 가능하다.
  • 시각적 비교 결과, EventSR는 기본 방법 대비 더 선명한 윤곽선, 더 명확한 질감, 더 자연스러운 세부 사항을 생성하며, 특히 초해상도 처리 단계(×4)에서 두드러진다.
Figure 2: An illustration of the proposed EventSR consisting of three phases: event to image reconstruction (Phase 1), event to image restoration (Phase 2), and event to image super-resolution (Phase 3) via unsupervised adversarial learning. With well designed training and test dataset, EventSR not
Figure 2: An illustration of the proposed EventSR consisting of three phases: event to image reconstruction (Phase 1), event to image restoration (Phase 2), and event to image super-resolution (Phase 3) via unsupervised adversarial learning. With well designed training and test dataset, EventSR not

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.