Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Multi-Stage Video Denoising with Recurrent Spatio-Temporal Fusion

Matteo Maggioni, Yibin Huang|arXiv (Cornell University)|2021. 03. 09.
Image and Signal Denoising Methods참고 문헌 39인용 수 4
한 줄 요약

이 논문은 계산 복잡도를 줄이면서 성능을 유지하거나 향상시키기 위해 학습 가능한 가역 변환을 통해 순환적인 시공간 융합을 활용하는 효율적인 다단계 영상 노이즈 제거 프레임워크인 EMVD를 제안한다. 시간적 융합, 공간적 노이즈 제거, 정밀 조정 단계를 변환 도메인에서 적용함으로써 EMVD는 5.38 GFLOPs와 36ms 추론 시간으로 모바일 SoC에서 실시간 720p 영상 노이즈 제거를 구현하며, 364배 높은 복잡도를 가진 최신 기술들조차도 뛰어넘는 성능을 발휘한다.

ABSTRACT

In recent years, denoising methods based on deep learning have achieved unparalleled performance at the cost of large computational complexity. In this work, we propose an Efficient Multi-stage Video Denoising algorithm, called EMVD, to drastically reduce the complexity while maintaining or even improving the performance. First, a fusion stage reduces the noise through a recursive combination of all past frames in the video. Then, a denoising stage removes the noise in the fused frame. Finally, a refinement stage restores the missing high frequency in the denoised frame. All stages operate on a transform-domain representation obtained by learnable and invertible linear operators which simultaneously increase accuracy and decrease complexity of the model. A single loss on the final output is sufficient for successful convergence, hence making EMVD easy to train. Experiments on real raw data demonstrate that EMVD outperforms the state of the art when complexity is constrained, and even remains competitive against methods whose complexities are several orders of magnitude higher. Further, the low complexity and memory requirements of EMVD enable real-time video denoising on commercial SoC in mobile devices.

연구 동기 및 목표

  • 실시간 모바일 장치에의 구현을 방해하는 최신 딥러닝 기반 영상 노이즈 제거 기법들의 높은 계산 복잡도 문제를 해결하기 위해.
  • 모델 복잡도를 저감시키되 성능을 훼손하지 않도록, 영상 내 시공간 상관관계를 체계적인 다단계 처리 파이프라인을 통해 활용하기 위해.
  • 각 단계가 명시적 지도 없이 자연스럽게 수렴하는 훈련 友好的 아키텍처를 설계하여 해석 가능성과 제어 가능성을 확보하기 위해.
  • 최소한의 메모리 사용량으로도 상업적 모바일 SoC에서 실시간 추론을 달성하면서도 경쟁력 있는 PSNR 및 SSIM 점수를 유지하기 위해.

제안 방법

  • EMVD는 시간적 융합, 공간적 노이즈 제거, 시공간 정밀 조정의 세 단계 아키텍처를 채택하며, 각 단계는 학습 가능한 가역 선형 연산자로부터 유도된 변환 도메인 표현에서 작동한다.
  • 시간적 융합 단계는 순환 메커니즘을 통해 과거 프레임을 반복적으로 통합하여 노이즈를 줄인 후 노이즈 제거를 수행한다.
  • 공간적 노이즈 제거 단계는 변환 도메인에서 융합된 프레임에 대해 CNN 기반 노이즈 제거기를 적용하여 잔여 노이즈를 제거한다.
  • 정밀 조정 단계는 시공간적 맥락을 적응적으로 활용하여 고주파 성분을 복원함으로써 정밀도를 향상시킨다.
  • 모든 단계는 색상 및 주파수 성분 간 상관관계를 감소시켜 정확도 향상과 복잡도 감소를 동시에 달성하는 공유된 학습 가능한 가역 변환을 사용한다.
  • 최종 출력에 대한 단일 엔드 투 엔드 손실만으로도 각 단계에 대한 보조 지도 없이도 효과적인 훈련이 가능하다.

실험 결과

연구 질문

  • RQ1기존 딥러닝 기반 방법들과 비교해 계산 복잡도가 극적으로 감소한 다단계 영상 노이즈 제거 프레임워크가 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2비순환적 다중 프레임 방법과 비교해 순환적 시공간 융합 메커니즘이 장기적인 시간적 일관성과 성능 측면에서 어떤가?
  • RQ3학습 가능한 가역 변환이 영상 노이즈 제거에서 정확도와 효율성 향상에 얼마나 기여할 수 있는가?
  • RQ4이러한 경량 아키텍처가 상당한 품질 저하 없이 상업적 모바일 SoC에서 실시간 성능을 달성할 수 있는가?

주요 결과

  • EMVD는 CRVD 데이터셋에서 5.38 GFLOPs에서 38.27 dB PSNR와 0.9722 SSIM을 기록하며, 5.7배 더 복잡도가 낮은 EDVR(37.43 dB)와 FastDVDnet를 뛰어넘는 성능을 보였다.
  • 5.38 GFLOPs에서 EMVD는 RViDeNet(79 GFLOPs)보다 0.84 dB PSNR 높고, 화웨이 P40 프로 스마트폰에서 4.9배 빠르며 메모리 사용량은 6.5배 적게 사용했다.
  • 25배 더 큰 RViDeNet 모델보다도 0.03 dB의 PSNR 우수성을 유지함으로써, 낮은 복잡도에서도 뛰어난 성능 효율성을 입증했다.
  • SRVD 데이터셋에서 EMVD는 다중 프레임 기반 모델들과 비교해 뛰어난 시간적 안정성을 보이며, 특히 장시간 영상에서 점점 더 높은 PSNR 향상을 기록했다.
  • EMVD는 상업적 모바일 SoC(Huawei P40 Pro)에서 약 30 fps로 실시간 성능을 달성하여, 720p 영상을 36ms 내로 처리했고, DDR 메모리는 단 112 MB만 사용했다.
  • 모델의 순환 설계 덕분에 동적인 장면에서 더 빠른 수렴을 이룰 수 있었으며, 몇 프레임만 처리한 후에도 다른 방법들보다 2 dB 이상 높은 PSNR 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.