Skip to main content
QUICK REVIEW

[논문 리뷰] Atmospheric turbulence removal using convolutional neural network

Jing Gao, Nantheera Anantrasirichai|arXiv (Cornell University)|2019. 12. 22.
Advanced Image Processing Techniques참고 문헌 13인용 수 16
한 줄 요약

이 논문은 대기 난류로 인해 손상된 영상 시퀀스를 복원하기 위해 수정된 잔차 U-Net 아키텍처를 사용하는 딥러닝 기반 방법을 제안한다. 시공간 잔차 학습과 배치 정규화를 활용한 엔드 투 엔드 훈련을 통해 블러, 리플리플 효과를 효과적으로 제거하고 대trast를 향상시켜 실제 데이터에서 최신 기술 대비 최대 3.8% 높은 PSNR와 23배 빠른 추론 성능을 달성한다.

ABSTRACT

This paper describes a novel deep learning-based method for mitigating the effects of atmospheric distortion. We have built an end-to-end supervised convolutional neural network (CNN) to reconstruct turbulence-corrupted video sequence. Our framework has been developed on the residual learning concept, where the spatio-temporal distortions are learnt and predicted. Our experiments demonstrate that the proposed method can deblur, remove ripple effect and enhance contrast of the video sequences simultaneously. Our model was trained and tested with both simulated and real distortions. Experimental results of the real distortions show that our method outperforms the existing ones by up to 3.8% in term of the quality of restored images, and it achieves faster speed than the state-of-the-art methods by up to 23 times with GPU implementation.

연구 동기 및 목표

  • 기존 영상 처리 기법이 고비용 계산, 복잡한 최적화 및 수동 파rameter 조정으로 인해 한계를 보이는 데에 대비하여, 이를 해결하고자 한다.
  • 대기 난류로 인한 영상 시퀀스에서 동시에 블러 제거, 리플리플 제거, 대trast 향상을 수행할 수 있는 엔드 투 엔드 딥러닝 프레임워크를 개발하고자 한다.
  • 사전에 고품질 프레임을 선별할 필요 없이 단일 프레임 또는 다수 프레임의 평균값을 최소 입력으로 사용하여 실시간으로 영상 시퀀스를 즉각적으로 복원할 수 있도록 하고자 한다.
  • 더 큰 수신장과 잔차 학습을 적용해 DnCNN 아키텍처를 개선함으로써, 복잡하고 알려지지 않은 난류 패턴을 가진 실제 환경에서의 복원 성능과 견고성을 향상시키고자 한다.

제안 방법

  • DnCNN 기반의 수정된 U-Net 유사 잔차 합성곱 신경망(CNN)을 사용하며, 시공간 왜곡을 포괄하기 위해 수신장 확장을 위해 필터 크기를 $ n \times n $ (여기서 $ n > 3 $)로 확장한다.
  • 손실 함수는 평균 제곱오차로 정의되며, 입력과 진짜값 간의 차이를 모델링하기 위해 잔차 학습을 적용한다: $ L(\theta) = \frac{1}{2m} \sum_{i=1}^{m} |R(y_i;\theta) - (y_i - x_i)|^2 $.
  • 복원된 이미지와 진짜 이미지의 쌍 데이터를 사용해 역전파를 통해 재구성 오차를 최소화하도록 네트워크를 훈련시킨다.
  • 단일 프레임 입력과 다중 프레임 평균 입력(예: 20–30 프레임)의 두 가지 입력 전략을 평가하였으며, 후자는 복잡한 실제 환경에서의 안정성과 성능 향상에 기여한다.
  • 모든 레이어에 배치 정규화를 적용하여 훈련 속도를 가속화하고 수렴성을 향상시킨다.
  • GPU 가속을 통해 실시간 처리를 구현하였으며, 512×256 영상 프레임에서 초당 1638.4k 픽셀의 처리 속도를 달성했다.

실험 결과

연구 질문

  • RQ1딥 컨volution 신경망은 영상 시퀀스에서 대기 난류로 인한 복잡한 시공간 왜곡을 효과적으로 학습하고 역으로 복원할 수 있는가?
  • RQ2더 큰 수신장과 함께 잔차 학습을 적용할 경우, 표준 DnCNN 대비 난류 제거 성능이 향상되는가?
  • RQ3단일 왜곡 프레임 입력으로도 우수한 성능를 달성할 수 있는가, 아니면 실제 데이터에서 안정적인 결과를 얻기 위해 다중 프레임 평균화가 필수적인가?
  • RQ4특히 실시간 환경에서 기존 최신 기술(CW 및 CSP)과 비교해 제안된 방법의 속도와 품질은 어떠한가?

주요 결과

  • 제안된 방법은 실제 데이터셋에서 최신 기술 대비 최대 3.8% 높은 PSNR 성능을 기록하였으며, 'chimney' 시퀀스에서 최고 PSNR 33.68 dB를 달성했다.
  • 'building' 시퀀스에서는 평균 입력을 사용했을 때 PSNR 26.02 dB를 기록하여, CSP(25.37 dB)와 CW(25.18 dB)를 모두 초월했다.
  • GPU에서 프레임당 0.08초(초당 1638.4k 픽셀)의 처리 속도를 기록하여, CW 방법(초당 70.6k 픽셀) 대비 23배 더 빠른 성능을 보였다.
  • 주관적 평가 결과, 제안된 방법은 CSP 및 CW 대비 더 뛰어난 시각적 결과를 제공하였으며, 특히 세부 정보 유지와 잡음 감소 측면에서 뛰어났다.
  • 다중 프레임 평균 입력을 사용할 경우 복원 품질이 크게 향상되어, 'chimney' 시퀀스에서 최고 SSIM 0.97, 'building' 시퀀스에서는 0.88를 기록하며, CW 및 CSP를 모두 능가했다.
  • 이동 중인 물체가 있는 다이나믹한 시퀀스, 예를 들어 'moving car' 시퀀스에서도 모델은 높은 견고성을 보였으며, 평균 입력을 사용했을 때 진짜값과 유사한 결과를 도출했고, 기존 방법보다도 뛰어난 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.