Skip to main content
QUICK REVIEW

[논문 리뷰] First image then video: A two-stage network for spatiotemporal video denoising

Ce Wang, Shubo Zhou|arXiv (Cornell University)|2020. 01. 02.
Image and Signal Denoising Methods참고 문헌 37인용 수 10
한 줄 요약

이 논문은 먼저 프레임 내 잡음을 줄이기 위해 이미지 잡음 제거를 적용한 후에 공간-시간 잡음 제거를 수행하는 이단계 딥러닝 프레임워크인 FITVNet을 제안한다. 공간적 및 시간적 잡음 제거를 분리함으로써, Vimeo90K에서 최신 기술 수준(SOTA)의 PSNR 및 SSIM 점수를 달성하면서 TOFlow보다 5배 이상 빠른 속도로 작동하며, 보조 학습이 없는 경쟁력 있는 비지도 학습 변형도 제공하여 지도 학습 기반 기준 수준의 성능을 달성한다.

ABSTRACT

Video denoising is to remove noise from noise-corrupted data, thus recovering true signals via spatiotemporal processing. Existing approaches for spatiotemporal video denoising tend to suffer from motion blur artifacts, that is, the boundary of a moving object tends to appear blurry especially when the object undergoes a fast motion, causing optical flow calculation to break down. In this paper, we address this challenge by designing a first-image-then-video two-stage denoising neural network, consisting of an image denoising module for spatially reducing intra-frame noise followed by a regular spatiotemporal video denoising module. The intuition is simple yet powerful and effective: the first stage of image denoising effectively reduces the noise level and, therefore, allows the second stage of spatiotemporal denoising for better modeling and learning everywhere, including along the moving object boundaries. This two-stage network, when trained in an end-to-end fashion, yields the state-of-the-art performances on the video denoising benchmark Vimeo90K dataset in terms of both denoising quality and computation. It also enables an unsupervised approach that achieves comparable performance to existing supervised approaches.

연구 동기 및 목표

  • 빠르게 움직이는 객체의 경계에서 발생하는 운동 흐림 아티팩트를 해결하기 위해.
  • 고속 운동과 공간적 잡음이 동시에 발생할 경우에 어려움을 겪는 종단간 공간-시간 잡음 제거기의 한계를 극복하기 위해.
  • 공간적 잡음 제거와 시간적 잡음 제거를 분리하여 더 높은 견고성과 성능을 확보하기 위한 이단계 프레임워크를 설계하기 위해.
  • 제1단계 이미지 잡음 제거기의 출력을 제2단계의 자기지도 학습 신호로 활용하여 비지도 비디오 잡음 제거 접근법을 가능하게 하기 위해.
  • 플로우 기반 방법에 비해 훨씬 빠른 추론 시간을 확보하면서도 최신 기술 수준의 잡음 제거 품질을 달성하기 위해.

제안 방법

  • 이 방법은 이단계 신경망을 활용한다: 첫 번째로, 이미지 간 잡음 제거 모듈이 각 프레임을 독립적으로 처리하여 내부 프레임 잡음 감소.
  • 두 번째 단계에서는 노이즈가 감소된 프레임을 대상으로 표준 공간-시간 잡음 제거 네트워크(FastDVDNet 기반)를 적용하여 프레임 간 상관관계를 활용.
  • 전체 네트워크는 공간적 및 공간-시간 감독 신호를 조합한 균형 잡힌 손실 함수를 사용하여 종단간 엔드 투 엔드로 훈련된다.
  • 비지도 변형은 제2단계의 정제된 프레임 감독을 제1단계의 잡음 제거기 출력으로 대체하여 자기지도 학습을 가능하게 한다.
  • 제1단계 네트워크는 미세한 디테일과 텍스처를 유지하기 위해 인지적 손실과 패치 기반 잡음 제거 손실을 함께 훈련한다.
  • 다양한 노이즈 수준(가우시안 및 실제 세계의 노이즈 포함)에서 Vimeo90K 벤치마크를 대상으로 평가된다.

실험 결과

연구 질문

  • RQ1공간적 및 시간적 잡음 제거 단계를 분리하면, 빠르게 움직이는 영상 시퀀스에서 날카로운 객체 경계를 회복하는 데에 유리한가?
  • RQ2사전 이미지 잡음 제거 단계가 후속 공간-시간 비디오 잡음 제거의 성능와 안정성에 어떤 영향을 미치는가?
  • RQ3플로우 기반 방법에 비해 훨씬 빠른 속도로 작동하면서도 최신 기술 수준의 비디오 잡음 제거 성능을 달성할 수 있는가?
  • RQ4제1단계가 강력한 사전 지식을 제공할 경우, 순수하게 비지도 학습 전략이 비디오 잡음 제거에 얼마나 효과적인가?
  • RQ5이단계 설계가 높은 노이즈 수준과 도전적인 운동 조건에 대해 견고성을 향상시키는가?

주요 결과

  • FITVNet은 모든 테스트 노이즈 수준에서 Vimeo90K 데이터셋에서 최신 기술 수준의 PSNR 및 SSIM 점수를 달성하며, FastDVDNet과 TOFlow를 모두 능가한다.
  • FITVNet은 우수한 잡음 제거 품질을 유지하면서 TOFlow보다 5배 이상 빠른 속도로 작동하여 뛰어난 계산 효율성을 입증한다.
  • FITVNet의 비지도 변형은 정제된 프레임 감독이 없는 상태에서도 FastDVDNet(지도 학습 기반 최신 기술 수준 방법)과 유사한 성능을 달성한다.
  • 시각적 결과에서 FITVNet은 TOFlow 및 FastDVDNet이 뿌연 출력을 내는 빠른 운동 시나리오에서도 날카로운 객체 경계를 효과적으로 유지한다.
  • 제1단계 잡음 제거기의 출력은 공간적 잡음을 효과적으로 감소시켜 제2단계 네트워크가 운동 모델링에 집중할 수 있도록 도와주며, 특징 시각화 및 분석 실험을 통해 이를 확인할 수 있다.
  • 공간적 및 인지적 손실을 통합한 변형(FITVNet + jsc)은 모든 노이즈 수준에서 안정적인 성능을 보이며, 기본 모델은 낮은 노이즈(Gauss15)에서 어려움을 겪는 것으로 나타나 종단간 훈련에서 노이즈 분포에 민감함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.