[논문 리뷰] Event-Based Fusion for Motion Deblurring with Cross-modal Attention
이 논문은 새로운 교차 모odal 주의 메커니즘을 사용하여 프레임 기반 및 이벤트 기반 데이터를 융합하는 엔드 투 엔드 두 단계 deblurring 네트워크인 EFNet을 제안한다. 대칭적 누적 이벤트 표현과 단계 간 게이팅 연결을 도입함으로써, EFNet은 합성(고프로) 및 실세계(REBlur) 운동 흐림 벤치마크에서 최신 기술 수준의 성능을 달성하며, 이전 방법 대비 최대 2.47dB까지 PSNR를 향상시킨다.
Traditional frame-based cameras inevitably suffer from motion blur due to long exposure times. As a kind of bio-inspired camera, the event camera records the intensity changes in an asynchronous way with high temporal resolution, providing valid image degradation information within the exposure time. In this paper, we rethink the eventbased image deblurring problem and unfold it into an end-to-end two-stage image restoration network. To effectively fuse event and image features, we design an event-image cross-modal attention module applied at multiple levels of our network, which allows to focus on relevant features from the event branch and filter out noise. We also introduce a novel symmetric cumulative event representation specifically for image deblurring as well as an event mask gated connection between the two stages of our network which helps avoid information loss. At the dataset level, to foster event-based motion deblurring and to facilitate evaluation on challenging real-world images, we introduce the Real Event Blur (REBlur) dataset, captured with an event camera in an illumination controlled optical laboratory. Our Event Fusion Network (EFNet) sets the new state of the art in motion deblurring, surpassing both the prior best-performing image-based method and all event-based methods with public implementations on the GoPro dataset (by up to 2.47dB) and on our REBlur dataset, even in extreme blurry conditions. The code and our REBlur dataset will be made publicly available.
연구 동기 및 목표
- 기존의 이미지 전용 흐림 제거 방법이 극한 또는 실세계 운동 흐림을 다루는 데에 한계를 가진다는 문제를 해결하기 위해.
- 유의미한 이벤트 특징을 선택적으로 융합할 수 있도록 학습 가능한 주의 기반 메커니즘을 설계하여 이벤트와 이미지 모달 간의 융합을 향상시키기 위해.
- 흐림 제거를 위해 더 나은 운동 퇴화를 캡처할 수 있도록 물리학적으로 타당한 이벤트 표현을 개발하기 위해.
- 제어된 조건 하에서 심각한 운동 흐림을 캡처하는 새로운 실세계 벤치마크를 구축하기 위해 REBlur 데이터셋을 제공한다.
- 다중 수준 융합, 게이팅 정보 흐름, 두 단계 네트워크 아키텍처를 조합하여 뛰어난 흐림 제거 성능를 달성하기 위해.
제안 방법
- EFNet은 두 단계의 U-Net 유사 아키텍처를 사용하며, 첫 번째 단계에서 신규로 제안된 이벤트-이미지 교차 모달 주의(EICA) 모듈을 통해 다중 수준에서 이미지 및 이벤트 특징을 융합한다.
- EICA 모듈은 다중 헤드 채널별 주의를 적용하여 이미지 흐림 제거에 대한 관련성에 따라 이벤트 특징을 동적으로 가중함으로써 선택적 특징 융합을 가능하게 한다.
- 이미지 흐림 형성의 물리적 모델과 일치하도록 설계된 대칭적 누적 이벤트 표현(SCER)이 도입되었다.
- 이벤트 마스크 게이팅 연결(EMGC)은 첫 번째 단계의 인코더 및 디코더에서 두 번째 단계로 특징을 선택적으로 전달하여 핵심 정보를 유지한다.
- 네트워크는 짝지어진 흐릿한 이미지, 선명한 이미지 및 이벤트 스트림을 기반으로 엔드 투 엔드로 훈련되며, PSNR 및 SSIM 최적화를 위한 손실 함수가 사용된다.
- REBlur 데이터셋은 고정밀 슬라이드 레일과 제어된 조명 조건을 사용하여 수집되었으며, 실세계 운동 흐림과 지상 진실 선명한 이미지 및 이벤트 스트림을 제공한다.
실험 결과
연구 질문
- RQ1이벤트 및 이미지 특징 간 교차 모달 주의가 간단한 융합 전략에 비해 흐림 제거 성능을 크게 향상시킬 수 있는가?
- RQ2SCER와 같은 물리학적으로 타당한 이벤트 표현이 흐림 제거 작업에서 표준 이벤트 누적 방법보다 우수한가?
- RQ3게이팅 정보 흐름을 갖춘 두 단계 네트워크 아키텍처는 극도로 흐릿한 이미지를 복원하는 데 얼마나 효과적인가?
- RQ4이벤트 기반 흐림 제거 방법은 합성 데이터셋을 넘어서 실세계의 극한 운동 흐림 시나리오로 일반화될 수 있는가?
- RQ5다중 수준 융합 및 주의 메커니즘은 복원된 이미지에서 미세한 디테일과 에지 보존에 어떤 영향을 미치는가?
주요 결과
- EFNet은 고프로 데이터셋에서 PSNR 35.46 dB를 달성하였으며, 이미지 전용 단일 단계 기반 모델 대비 6.4 dB 향상되었다.
- REBlur 데이터셋에서 EFNet은 모든 이전의 이벤트 기반 및 이미지 기반 방법을 능가하였으며, 극한의 흐림 조건에서도 강건성을 입증하였다.
- EICA 융합 모듈은 요소별 덧셈, 곱셈, 연결과 비교해 PSNR를 0.6 dB 이상 향상시켰다.
- SCER 표현은 SBT(35.12 dB)와 'Stack' 표현(31.90 dB)을 모두 능가하며, 35.46 dB의 PSNR를 기록하여 그 효과를 입증하였다.
- EMGC 모듈은 네트워크 단계 간의 선택적이고 맥락 인식 정보 전달이 가능하게 하여 PSNR를 0.15 dB 향상시켰다.
- 절단 실험 결과 다중 수준 융합과 두 단계 설계가 핵심임을 확인하였으며, 전체 모델은 기반 모델 대비 SSIM에서 3.6% 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.