Skip to main content
QUICK REVIEW

[논문 리뷰] DPFNet: A Dual-branch Dilated Network with Phase-aware Fourier Convolution for Low-light Image Enhancement

Yunliang Zhuang, Zhuoran Zheng|arXiv (Cornell University)|2022. 09. 16.
Image Enhancement Techniques인용 수 13
한 줄 요약

DPFNet은 공간 도메인과 주파수 도메인 특징을 동시에 활용하기 위해 단일 위상 인식 푸리에 컨볼루션 모듈과 다중 수신장이 있는 확장 컨볼루션을 사용하는 双분지 컨볼루션 네트워크를 제안한다. 이는 저조도 이미지의 향상을 위한 것으로, 공개 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, LOL 데이터셋에서 이전 SOTA보다 PSNR 1.23 dB 향상되고 SSIM 0.012 향상되었으며, 새로운 푸리에 손실과 적응형 융합 모듈을 통해 더 뛰어난 텍스처 세부 정보와 자연스러운 시각적 품질을 확보하였다.

ABSTRACT

Low-light image enhancement is a classical computer vision problem aiming to recover normal-exposure images from low-light images. However, convolutional neural networks commonly used in this field are good at sampling low-frequency local structural features in the spatial domain, which leads to unclear texture details of the reconstructed images. To alleviate this problem, we propose a novel module using the Fourier coefficients, which can recover high-quality texture details under the constraint of semantics in the frequency phase and supplement the spatial domain. In addition, we design a simple and efficient module for the image spatial domain using dilated convolutions with different receptive fields to alleviate the loss of detail caused by frequent downsampling. We integrate the above parts into an end-to-end dual branch network and design a novel loss committee and an adaptive fusion module to guide the network to flexibly combine spatial and frequency domain features to generate more pleasing visual effects. Finally, we evaluate the proposed network on public benchmarks. Extensive experimental results show that our method outperforms many existing state-of-the-art ones, showing outstanding performance and potential.

연구 동기 및 목표

  • 표준 CNN이 저조도 이미지 증강 과정에서 고주파 텍스처 세부 정보를 유지하는 데에 한계가 있다는 문제를 해결하기 위해.
  • 특히 위상 의미 정보를 포함한 주파수 도메인 정보를 공간 도메인 복원 과정에 통합하여 세부 정보 복구를 향상시키기 위해.
  • 에코더-디코더 아키텍처에서 반복적인 다운샘플링으로 인한 세부 정보 손실을 줄이기 위해 다중 수신장이 있는 확장 컨볼루션을 사용하기 위해.
  • 적응형 융합 모듈과 새로운 푸리에 손실 함수를 통해 공간 도메인과 주파수 도메인 특징 융합을 균형 있게 조절하기 위해.
  • 실세계 및 벤치마크 데이터셋에서 개선된 인지 품질과 강건성을 확보하는 엔드 투 엔드 증강을 달성하기 위해.

제안 방법

  • 푸리에 도메인에서 위상 정보를 활용하기 위해 위상 인식 푸리에 컨볼루션 모듈을 설계하였으며, 공유 메모리 가중치를 사용해 크기와 위상을 동적으로 조합하여 특징 표현을 향상시켰다.
  • 다양한 비율의 확장 컨볼루션을 공간 분지에 적용하여 수신장을 확장하고, 다운샘플링으로 인한 특징 손실을 줄였다.
  • 이중 분지 네트워크 아키텍처를 통해 공간 및 주파수 특징을 병렬로 처리하여 국소적 및 전반적인 이미지 특징을 공동 학습할 수 있도록 하였다.
  • 적응형 융합 모듈을 통해 양 분지의 특징을 융합하였으며, 입력 콘텐츠에 따라 각 분지의 기여도를 동적으로 조정하였다.
  • 손실 위원회에는 SSIM 손실, 푸리에 손실, 인지 손실이 포함되어 훈련을 지도함: SSIM은 구조적 정밀도를 확보하고, 푸리에 손실은 고주파 세부 정보 인식을 향상시키며, 인지 손실은 자연스러움을 향상시킴.
  • 푸리에 손실은 증강된 이미지와 진짜 이미지의 위상 및 크기 성분을 비교하여 주파수 도메인 복원을 정규화하기 위해 특별히 설계됨.

실험 결과

연구 질문

  • RQ1위상 인식 푸리에 컨볼루션을 통해 의미 있는 위상 정보를 활용함으로써 저조도 이미지 증강에서 텍스처 세부 정보 복구가 향상될 수 있는가?
  • RQ2다양한 스케일의 수신장을 가진 확장 컨볼루션을 사용할 경우, 표준 다운샘플링 CNN에 비해 세부 정보 손실이 감소하는가?
  • RQ3이중 분지 네트워크 아키텍처가 공간 및 주파수 도메인 특징을 효과적으로 융합하여 향상된 증강 성능을 달성할 수 있는가?
  • RQ4푸리에 손실과 적응형 융합 모듈의 포함 여부가 증강 결과의 인지 품질과 안정성에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 합성 기반 벤치마크를 넘어서 실제 저조도 이미지에 대해 얼마나 일반화되는가?

주요 결과

  • LOL 데이터셋에서 DPFNet은 PSNR 24.15 dB, SSIM 0.849를 기록하였으며, 이는 이전 SOTA인 LLFlow보다 PSNR 1.23 dB 향상되고 SSIM 0.012 향상된 성능이다.
  • MIT-5K 데이터셋에서 DPFNet은 PSNR 25.33 dB, SSIM 0.910을 달성하여 다른 최신 기술 수준 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 절단 분석 결과, 위상 인식 푸리에 모듈을 추가함으로써 기본 모델인 MDCM 대비 LOL에서 PSNR 2.51 dB 향상되고, MIT-5K에서는 0.92 dB 향상됨.
  • 적응형 융합 모듈은 LOL 데이터셋에서 추가로 0.48 dB의 PSNR 향상을 기록하였고, MIT-5K에서는 0.49 dB 향상되어 도메인 특징 균형 조절의 효과를 입증함.
  • 시각적 비교 결과, DPFNet은 BIMEF, LIME, KinD++, LLFlow에 비해 가장 날카운 텍스처와 더 적은 잡음 및 아티팩트를 생성하였으며, 특히 윤곽선 및 세밀한 세부 정보 영역에서 뛰어난 성능을 보였다.
  • 손실 위원회에 인지 손실을 포함시킴으로써 더 자연스러운 출력이 유도되었으며, 푸리에 손실만 사용했을 때 나타나는 과도한 증강 효과를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.