Skip to main content
QUICK REVIEW

[논문 리뷰] Generic Model-Agnostic Convolutional Neural Network for Single Image Dehazing

Zheng Liu, Botao Xiao|arXiv (Cornell University)|2018. 10. 05.
Image Enhancement Techniques인용 수 9
한 줄 요약

이 논문은 대기 산란 모델에 의존하거나 투과도(t)와 같은 매개변수를 추정하지 않고도 안개가 제거된 이미지를 직접 학습하는 일반적인, 모델에 종속되지 않는 컨볼루션 신경망(GMAN)을 제안한다. 잔차 블록을 갖춘 엔드 투 엔드 인코더-디코더 아키텍처는 SOTS 실외 데이터셋에서 PSNR 28.19와 SSIM 0.9638을 기록하며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Haze and smog are among the most common environmental factors impacting image quality and, therefore, image analysis. This paper proposes an end-to-end generative method for image dehazing. It is based on designing a fully convolutional neural network to recognize haze structures in input images and restore clear, haze-free images. The proposed method is agnostic in the sense that it does not explore the atmosphere scattering model. Somewhat surprisingly, it achieves superior performance relative to all existing state-of-the-art methods for image dehazing even on SOTS outdoor images, which are synthesized using the atmosphere scattering model. Project detail and code can be found here: https://github.com/Seanforfun/GMAN_Net_Haze_Removal

연구 동기 및 목표

  • 대기 산란 모델에 의존하고 플러그인 방식의 매개변수 추정에 의존하는 모델 종속성의 한계를 해결하기 위해.
  • 대기 밝기(A)와 투과도 t(x)를 추정하지 않고도 안개가 제거된 이미지를 직접 복원할 수 있는 일반적이고 엔드 투 엔드 딥 러닝 프레임워크를 개발하기 위해.
  • 일반화 성능를 향상시키고 기존 방법에서 흔히 발생하는 색상 왜곡 및 가장자리 과도한 선명화 등의 일반적인 아티팩트를 방지하기 위해.
  • 이미지 복원 분야에서 안개 제거를 넘어서 더 넓은 범위의 응용에 적합한 보다 일반적인 아키텍처 종속적이지 않은 접근 방식의 잠재력을 탐색하기 위해.

제안 방법

  • 모든 레이어에 64개 필터를 사용하며, 다운샘플링 레이어에선 128개 필터를 사용하는 완전 컨볼루션 인코더-디코더 네트워크를 제안하며, $3\times3$ 커널과 ReLU 활성화 함수를 사용한다.
  • 계층적인 안개 특징을 학습하고 기울기 흐름을 향상시키기 위해 깊이가 증가하는 네 개의 잔차 블록(각각 2, 2, 3, 4개의 컨볼루션 레이어)을 활용한다.
  • 픽셀 단위의 L2 손실 함수를 사용해 네트워크를 엔드 투 엔드로 훈련한다: $L = \sum_{i} \| \hat{Y}_i - Y_i \|^2$, 재구성 오차를 최소화한다.
  • 훈련 중에는 입력 크기를 $224\times224$로 설정하고 무작위 컷팅을 적용하지만, 추론 시에는 임의의 입력 크기를 지원한다.
  • NVIDIA Titan Xp GPU에서 배치 크기 35로 Adam 옵timizer를 사용하며, 초기 학습률 0.001, $\beta_1=0.9$, $\beta_2=0.999$로 설정한다.
  • 손실이 0.0004로 수렴할 때까지 20 에포크 동안 네트워크를 훈련시켰으며, 이는 안정적이고 효과적인 수렴을 의미한다.

실험 결과

연구 질문

  • RQ1모델 종속적이지 않은 딥 러닝 접근 방식이 대기 산란 모델에 의존하는 최신 기술 수준의 방법보다 뛰어난 성능을 낼 수 있는가?
  • RQ2A와 t(x)의 추정 없이 직접 엔드 투 엔드 이미지 복원을 수행할 경우, 더 나은 일반화 성능와 더 적은 아티팩트를 달성할 수 있는가?
  • RQ3일반적인 완전 컨볼루션 아키텍처가 합성 및 실세계 안개 제거 벤치마크에서 뛰어난 성능을 달성할 수 있는가?
  • RQ4색상 충실도와 가장자리 보존 측면에서 플러그인 기반 방법과 비교해 본다면, 제안된 방법은 어떤가?
  • RQ5GMAN와 같은 일반적인 아키텍처가 안개 제거를 넘어서 다른 이미지 복원 작업으로도 얼마나 일반화될 수 있는가?

주요 결과

  • SOTS 실외 데이터셋에서 GMAN는 PSNR 28.19와 SSIM 0.9638을 기록하며, DCP, DehazeNet, MSCNN, AOD-Net, GFN 등 모든 경쟁 방법보다 뛰어난 성능을 보였다.
  • GMAN는 DCP에서 흔한 색상 어두워짐과 MSCNN에서 흔한 과도한 가장자리 선명화 등의 일반적인 아티팩트를 피했다.
  • SOTS 실내 데이터셋에서 GMAN는 PSNR 20.53과 SSIM 0.8081을 기록했으며, 비교된 방법들 중 네 번째로 높은 순위를 기록했으며, 실내 환경에서는 강력하지만 우세한 성능은 아니었다.
  • 대기 산란 모델이 완전히 반영하지 못하는 복잡한 안개 구조에 대해서도 모델이 강건함을 보였으며, 이는 더 일반화된 특징을 학습했음을 시사한다.
  • 20 에포크 후 손실이 0.0004로 수렴하여 안정적이고 효과적인 최적화가 이루어졌음을 나타낸다.
  • 결과적으로 모델 종속적이지 않은 엔드 투 엔드 학습 방식이, 특히 이미지 품질과 자연스러운 외관을 유지하는 데서 모델 기반 플러그인 방법을 초월할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.