Skip to main content
QUICK REVIEW

[논문 리뷰] Semi-Supervised Video Deraining with Dynamical Rain Generator

Zongsheng Yue, Jianwen Xie|arXiv (Cornell University)|2021. 03. 14.
Image Enhancement Techniques참고 문헌 65인용 수 4
한 줄 요약

이 논문은 깊이 신경망으로 파arameter화된 방출 모델과 전이 모델을 통해 시공간적 과정으로 비층을 모델링하는 역학적 비 생성기를 사용하여, 반감독 학습 기반의 비 영상 제거 방법을 제안한다. 레이블이 부여된 합성 데이터와 레이블이 없는 실제 비 영상 데이터를 함께 활용함으로써, 실제 환경 조건에 대한 일반화 능력을 향상시켜, 합성 및 실제 기준 모두에서 최신 기술 수준의 성능을 달성한다. 특히 다양한 복잡한 비 패턴을 효과적으로 처리하는 데 뛰어나다.

ABSTRACT

While deep learning (DL)-based video deraining methods have achieved significant success recently, they still exist two major drawbacks. Firstly, most of them do not sufficiently model the characteristics of rain layers of rainy videos. In fact, the rain layers exhibit strong physical properties (e.g., direction, scale and thickness) in spatial dimension and natural continuities in temporal dimension, and thus can be generally modelled by the spatial-temporal process in statistics. Secondly, current DL-based methods seriously depend on the labeled synthetic training data, whose rain types are always deviated from those in unlabeled real data. Such gap between synthetic and real data sets leads to poor performance when applying them in real scenarios. Against these issues, this paper proposes a new semi-supervised video deraining method, in which a dynamic rain generator is employed to fit the rain layer, expecting to better depict its insightful characteristics. Specifically, such dynamic generator consists of one emission model and one transition model to simultaneously encode the spatially physical structure and temporally continuous changes of rain streaks, respectively, which both are parameterized as deep neural networks (DNNs). Further more, different prior formats are designed for the labeled synthetic and unlabeled real data, so as to fully exploit the common knowledge underlying them. Last but not least, we also design a Monte Carlo EM algorithm to solve this model. Extensive experiments are conducted to verify the superiorities of the proposed semi-supervised deraining model.

연구 동기 및 목표

  • 딥 러닝 기반의 제거 방법의 일반화 능력을 제한하는 합성 비 영상 데이터와 실제 비 영상 데이터 사이의 격차를 해소하기 위해.
  • 방향, 척도, 두께, 속도, 가속도 등의 비층의 내재된 시공간적 특성—예를 들어, 방향, 척도, 두께, 속도, 가속도—을 통계적 시공간 과정을 통해 모델링하기 위해.
  • 레이블이 부여된 합성 데이터와 레이블이 없는 실제 비 영상 데이터 간의 공유 지식을 활용하는 반감독 학습 프레임워크를 개발하기 위해.
  • 합성 데이터만으로는 성능이 떨어지는 실제 환경의 제거 시나리오에서의 강인성과 일반화 능력을 향상시키기 위해.

제안 방법

  • 깊이 신경망으로 파arameter화된 방출 모델(공간적 외관에 대해)과 전이 모델(비 줄무늬의 시간적 동역학에 대해)을 포함하는 역학적 비 생성기를 도입한다.
  • 모수를 최적화하기 위해 몬테 카를로 기반 기대값 최대화(EM) 알고리즘을 사용하며, 이는 가능도 항과 MRF 기반 정규화 항을 최적화한다.
  • 반감독 학습 철학을 채택하여, 레이블이 부여된 합성 데이터와 레이블이 없는 실제 비 영상 데이터를 함께 활용하여 일반화 능력을 향상시킨다.
  • 합성 데이터와 실제 데이터의 분포 격차를 고려하면서도 잠재적인 공통 지식을 활용하기 위해 서로 다른 사전 형식을 설계한다.
  • 목적 함수의 가능도 항은 관측된 비 영상에 대해 비층의 확률을 모델링하며, MRF 사전은 프레임 간의 공간 일관성을 강제한다.
  • 초기화 파라미터 ρ는 진짜 레이블의 지도 학습과 MRF 사전 간의 균형을 조절하며, 최적의 균형을 확보하기 위해 ρ = 0.5를 선택한다.

실험 결과

연구 질문

  • RQ1비층을 정적 또는 순수하게 합성 방식으로 모델링하는 것과 비교해, 시공간 과정으로 모델링함으로써 영상 제거 성능을 향상시킬 수 있는가?
  • RQ2반감독 프레임워크 내에서 레이블이 없는 실제 비 영상 데이터를 효과적으로 활용하여, 합성 데이터를 넘어서 일반화 능력을 향상시킬 수 있는가?
  • RQ3방출 모델과 전이 모델을 갖춘 역학적 비 생성기를 도입함으로써, 다양한 복잡한 실제 비 패턴을 처리하는 데 어떤 영향을 미치는가?
  • RQ4MRF 사전는 합성 데이터에서 과적합을 방지하면서도 실제 데이터에서의 성능 향상에 어떻게 기여하는가?

주요 결과

  • 제안된 S2VD 방법은 합성 및 실제 기준 모두에서 최신 기술 수준의 성능을 달성하였으며, 합성 데이터에서 MSE 전용 기준 대비 1.01 dB의 PSNR 향상을 기록하였다.
  • 가능도 항과 MRF 정규화 항의 추가로 성능이 0.0071 SSIM 향상되었으며, 이는 시각적 비교를 통해 합성 데이터를 넘어서는 일반화 능력 향상이 확인되었다.
  • S2VD는 학습 중에 볼 수 없었던 실제 비 영상 데이터에 대해서도 잘 일반화되며, NTURain의 실제 테스트 세트에서 뛰어난 시각적 결과를 보였다.
  • 이 방법은 다양한 비 패턴에 대해 강인하며, 특히 복잡한 실제 환경 시나리오에서 기존 방법들을 능가하는 성능을 보였다.
  • 절단 실험을 통해 가능도 항, MRF 사전, 반감독 학습 각각의 구성 요소가 성능 향상에 기여하고 있음을 확인하였다.
  • 큰 카메라 운동이나 무거운 비 줄무늬가 있는 경우 실패 케이스가 발생하며, 이는 현재 MRF 사전가 극단적인 동역학을 모델링하는 데 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.