[논문 리뷰] Y-net: Multi-scale feature aggregation network with wavelet structure similarity loss function for single image dehazing
이 논문은 단일 이미지 화창화를 위한 다중 척도 특징 집약 U-Net 변종인 Y-Net을 제안하며, 1×1 합성곱을 사용해 다중 척도 특징을 융합하고 웨이블릿 구조 유사도(W-SSIM) 손실 함수를 도입함으로써 최신 기법들을 능가한다. W-SSIM 손실 함수는 다중 척도 웨이블릿 하위대역에서 SSIM을 적용하여 인지적 품질을 향상시키고, 세부 사항 보존을 개선하며 잡음과 기능을 감소시킨다.
Single image dehazing is the ill-posed two-dimensional signal reconstruction problem. Recently, deep convolutional neural networks (CNN) have been successfully used in many computer vision problems. In this paper, we propose a Y-net that is named for its structure. This network reconstructs clear images by aggregating multi-scale features maps. Additionally, we propose a Wavelet Structure SIMilarity (W-SSIM) loss function in the training step. In the proposed loss function, discrete wavelet transforms are applied repeatedly to divide the image into differently sized patches with different frequencies and scales. The proposed loss function is the accumulation of SSIM loss of various patches with respective ratios. Extensive experimental results demonstrate that the proposed Y-net with the W-SSIM loss function restores high-quality clear images and outperforms state-of-the-art algorithms. Code and models are available at https://github.com/dectrfov/Y-net.
연구 동기 및 목표
- 대기 밝기나 투과율에 대한 명시적 사전 지식 없이 엔드 투 엔드로 학습하여 단일 이미지 화창화 문제의 불안정한 성격을 해결한다.
- CNN 인코더-디코더의 다양한 층에서 유도된 다중 척도 특징을 집약함으로써 이미지 복원 품질을 향상시킨다.
- 이산 웨이블릿 변환과 SSIM을 기반으로 한 새로운 손실 함수를 설계하여 인지적 품질을 향상시키고 잡음을 감소시킨다.
- 기존의 기반 기반 및 딥 러닝 기반 화창화 기법들과 비교하여 합성 데이터셋에서 뛰어난 성능을 입증한다.
제안 방법
- 1×1 합성곱을 사용해 인코더 및 디코더 경로에서 유도된 다중 척도 특징 맵을 융합하여 최종 출력을 형성하는 Y-형 네트워크 아키텍처를 제안한다.
- U-Net과 유사하게 스트라이드 합성곱과 맥스 풀링을 사용해 다운샘플링하고, 트랜스포지드 합성곱을 사용해 업샘플링하지만, 최종 스킵 연결 대신 다중 척도 융합을 적용한다.
- 이산 웨이블릿 변환(DWT)을 반복적으로 적용하여 다양한 척도와 주파수의 하위대역으로 이미지를 분해하는 웨이블릿 SSIM(W-SSIM) 손실 함수를 도입한다.
- 고주파 하위대역(LH, HL, HH)과 저주파 하위대역(LL)에서 SSIM을 계산하며, 고주파 세부 정보를 우선시하고 환영 잡음을 억제하기 위해 조정 가능한 가중치를 사용한다.
- 세 번의 반복을 거치는 재귀적 DWT 프로세스를 사용하며, 하르 웨이블릿을 적용하고, 다중 척도 일致성 확보를 위해 가변 비율(x = r², y = r(1−r), z = (1−r)²)로 SSIM 손실을 누적한다.
- RESIDE 데이터셋에서 배치 크기 32, 입력 해상도 480×480, 학습률 0.0001로 Adam 옵timizer를 사용해 네트워크를 훈련시킨다.

실험 결과
연구 질문
- RQ1U-Net 유사 아키텍처에서 다중 척도 특징 융합이 표준 스킵 연결에 비해 화창화 성능을 크게 향상시킬 수 있는가?
- RQ2웨이블릿 기반 SSIM 손실 함수가 표준 L2 또는 SSIM 손실 함수보다 이미지 화창화에서 더 나은 인지적 품질과 낮은 잡음을 제공하는가?
- RQ3제안된 W-SSIM 손실 함수는 명시적 깊이 또는 투과율 사전 지식 없이도 다중 주파수 대역에서 특징 학습을 향상시킬 수 있는가?
- RQ4W-SSIM과 L2 손실의 조합이 개별 손실 함수에 비해 화창화 이미지의 PSNR 및 SSIM 측정치에서 더 나은 성능을 보이는가?
주요 결과
- 제안된 Y-Net은 합성 데이터셋 RESIDE에서 PSNR 26.61과 SSIM 0.947을 기록하여 AOD-Net, MBE, W-U-Net 등 비교 기법들을 모두 능가한다.
- W-SSIM 손실만으로도 표준 L2 손실 대비 PSNR 0.30 향상, SSIM 0.012 향상되며, L2 손실과 조합 시 PSNR 26.61, SSIM 0.947로 더욱 향상된다.
- FADE 인지 평가 지표에서 제안된 방법은 강아지(1.77), 사람(2.37), 백양나무(0.592)에서 각각 높은 점수를 기록하여 모든 베이스라인보다 인지적 품질에서 뛰어난 성능을 보였다.
- 시각적 결과에서는 유일하게 제안된 방법만 강둑 표면의 안개를 효과적으로 제거하면서 잡음이나 기능을 유발하지 않았고, MBE와 같은 다른 방법들은 점박이 잡음을 유발했다.
- W-SSIM 손실 함수는 고주파 세부 정보를 효과적으로 보존하고 환영 효과를 억제함으로써 모든 테스트 이미지에서 향상된 SSIM 및 인지 평가 점수를 입증했다.
- 절단 분석 결과 W-SSIM 손실 함수가 L2 또는 표준 SSIM 손실 함수보다 더 효과적임을 확인하였으며, 이는 네트워크가 인지적으로 우수한 재구성을 향해 유도할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.