[논문 리뷰] A Comprehensive Survey and Taxonomy on Single Image Dehazing Based on Deep Learning
이 논문은 딥러닝 기반 단일 이미지 화창화 방법에 대한 종합적인 서베이와 분류 체계를 제시하며, 지도학습, 준지도학습, 비지도학습 접근법을 분류한다. 대기 산란 모델, 손실 함수, 데이터셋, 평가 지표 등의 핵심 구성 요소를 분석하고, 도메인 일반화 및 감각적 손실 최적화와 같은 열린 과제를 밝힌다.
With the development of convolutional neural networks, hundreds of deep learning based dehazing methods have been proposed. In this paper, we provide a comprehensive survey on supervised, semi-supervised, and unsupervised single image dehazing. We first discuss the physical model, datasets, network modules, loss functions, and evaluation metrics that are commonly used. Then, the main contributions of various dehazing algorithms are categorized and summarized. Further, quantitative and qualitative experiments of various baseline methods are carried out. Finally, the unsolved issues and challenges that can inspire the future research are pointed out. A collection of useful dehazing materials is available at \url{https://github.com/Xiaofeng-life/AwesomeDehazing}.
연구 동기 및 목표
- 딥러닝 기반 단일 이미지 화창화 방법에 대한 체계적인 리뷰를 제공함: 지도학습, 준지도학습, 비지도학습 접근법 포함.
- 화창화 모델의 핵심 구성 요소인 네트워크 아키텍처, 손실 함수, 평가 지표를 분석하고 분류함.
- 실제 환경에서의 화창화에 남아 있는 과제, 예를 들어 도메인 이동, 일반화 가능한 사전 지식의 부족, 고수준 비전 작업에 미치는 영향 등을 특정하고 논의함.
- 미래 연구를 위해 GitHub 리포지토리에서 화창화 방법과 자료를 체계적으로 정리하여 제공함.
제안 방법
- 화창화 방법을 ASM 기반 및 비-ASM 기반 접근법으로 분류하고, 학습 철학(지도학습, 준지도학습, 비지도학습)에 따라 하위 분류를 제공함.
- 일반적으로 사용되는 데이터셋(예: SOTS, Cityscapes, KITTI), 평가 지표(예: PSNR, SSIM, LPIPS), 손실 함수(예: L1, 감각적 손실, GAN 손실)를 검토함.
- 최신 모델에서 사용되는 네트워크 모듈(예: 주의 메커니즘, 스킵 연결, 다중 해상도 특징)을 분석함.
- 표준 벤치마크를 사용하여 기준 모델 간의 정량적 및 정성적 성능을 비교함.
- 최근 비지도학습 및 준지도학습 연구의 통찰을 통합하여 합성 쌍 데이터에 대한 의존도를 줄임.
- 핵심 아이디어와 기술적 접근법에 따라 방법을 체계적으로 분류할 수 있도록 분류표(표 1)를 제안함.
실험 결과
연구 질문
- RQ1단일 이미지 화창화에 대해 지도학습, 준지도학습, 비지도학습 딥러닝 방법은 설계 및 성능 면에서 어떻게 다릅니까?
- RQ2화창화 품질 향상과 일반화 능력 향상에 가장 효과적인 손실 함수와 네트워크 아키텍처는 무엇입니까?
- RQ3기존 화창화 모델이 객체 검출 및 세그멘테이션과 같은 고수준 비전 작업에서 성능을 얼마나 향상시킵니까?
- RQ4기존 평가 지표가 감각적 품질과 실제 환경에서의 강인성을 얼마나 잘 반영하고 있습니까?
- RQ5사전 지식과 도메인 일반화 기법은 안개가 딥러닝 모델에 악영향을 미치는 데 어떻게 대비할 수 있습니까?
주요 결과
- 대기 산란 모델(ASM) 기반 및 엔드 투 엔드 CNN을 사용하는 지도학습 화창화 모델은 높은 성능을 달성하며, 일부 모델(예: 4kDehazing)은 125 fps(1帧당 8 ms)로 4K 이미지를 처리할 수 있음.
- 비-ASM 기반 화창화 네트워크는 ASM 기반 모델과 유사한 성능을 보이며, 딥러닝이 명시적 물리 모델링 없이도 화창화를 학습할 수 있음을 시사함.
- 준지도학습 및 비지도학습 방법은 합성 쌍 데이터에 대한 의존도를 줄여 실제 안개가 낀 이미지에 대한 일반화 능력을 향상시킴.
- VGG16/VGG19를 사용한 감각적 손실은 시각적 품질을 향상시키지만, 일반 목적의 손실로써의 역할은 검증되지 않았으며 최적의 솔루션이 아닐 수 있음.
- 일부 화창화 방법은 이미지 분류 모델에 제한적 또는 심지어 부정적인 영향을 미치며, 고수준 비전 작업에 잠재적 부작용이 있음을 시사함.
- CNN 기반 화창화에 대해 통용 가능한 통계적 사전 지식은 존재하지 않으며, 더 나은 일반화 가능한 사전 지식을 규명하기 위한 추가 연구가 필요함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.