Skip to main content
QUICK REVIEW

[논문 리뷰] Mutual Information-driven Triple Interaction Network for Efficient Image Dehazing

Hao Shen, Zhong‐Qiu Zhao|arXiv (Cornell University)|2023. 08. 14.
Image Enhancement TechniquesComputer Science인용 수 3
한 줄 요약

이 논문은 공간-주파수 이중 도메인 사전 지식을 활용하여 먼저 진폭 스펙트럼을 복원하고 나서 위상 스펙트럼을 정밀하게 보정하는 상호정보 기반의 이단계 dehazing 네트워크인 MITNet을 제안한다. 이는 콘텐츠에 적응하는 필터를 갖춘 상호작용 모듈(Adaptive Triple Interaction Module, ATIM)을 도입하여 도메인 간(공간/주파수), 스케일 간, 스테이지 간 특징을 융합하며, 레이어 간 중복을 줄이기 위해 상호정보 최소화 기법을 적용한다. 이로 인해 공개 벤치마크에서 최신 기술 수준의 성능을 달성하면서도 복잡도가 낮아졌다.

ABSTRACT

Multi-stage architectures have exhibited efficacy in image dehazing, which usually decomposes a challenging task into multiple more tractable sub-tasks and progressively estimates latent hazy-free images. Despite the remarkable progress, existing methods still suffer from the following shortcomings: (1) limited exploration of frequency domain information; (2) insufficient information interaction; (3) severe feature redundancy. To remedy these issues, we propose a novel Mutual Information-driven Triple interaction Network (MITNet) based on spatial-frequency dual domain information and two-stage architecture. To be specific, the first stage, named amplitude-guided haze removal, aims to recover the amplitude spectrum of the hazy images for haze removal. And the second stage, named phase-guided structure refined, devotes to learning the transformation and refinement of the phase spectrum. To facilitate the information exchange between two stages, an Adaptive Triple Interaction Module (ATIM) is developed to simultaneously aggregate cross-domain, cross-scale, and cross-stage features, where the fused features are further used to generate content-adaptive dynamic filters so that applying them to enhance global context representation. In addition, we impose the mutual information minimization constraint on paired scale encoder and decoder features from both stages. Such an operation can effectively reduce information redundancy and enhance cross-stage feature complementarity. Extensive experiments on multiple public datasets exhibit that our MITNet performs superior performance with lower model complexity.The code and models are available at https://github.com/it-hao/MITNet.

연구 동기 및 목표

  • 기존 이미지 dehazing 방법에서 주파수 도메인 정보 탐색이 제한적이라는 문제를 해결하기 위해.
  • 다단계 dehazing 아키텍처에서 스테이지 간 및 스케일 간 특징 상호작용을 향상시키기 위해.
  • 스테이지 간 명시적 보완 학습을 통해 특징 중복을 줄이기 위해.
  • 적응형, 맥락 인식 특징 조절을 통해 표현 능력을 향상시키기 위해.
  • 낮은 모델 복잡도로 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 네트워크는 이단계 설계를 채택한다: 첫 번째 스테이지는 안개 제거를 위해 안개가 낀 이미지의 진폭 스펙트럼을 복원하고, 두 번째 스테이지는 구조적 향상을 위해 위상 스펙트럼을 정밀하게 보정한다.
  • Adaptive Triple Interaction Module (ATIM)은 공간/주파수 도메인, 다양한 스케일, 여러 스테이지 간 특징을 융합하여 콘텐츠에 적응하는 동적 필터를 생성한다.
  • 이 동적 필터는 디코더 특징에 적용되어 적응형 특징 조절을 통해 전역적 맥락 표현을 향상시킨다.
  • 양방향 인코더-디코더 특징 쌍에 대해 상호정보 제약(Mutual Information Constraint, MIC)을 적용하여 레이어 간 중복을 최소화하고 보완 학습을 촉진한다.
  • 이 방법은 푸리에 도메인 사전 지식—진폭 스펙트럼은 안개 제거에, 위상 스펙트럼은 구조 보정에 활용—을 통합된 점진적 프레임워크에 통합한다.
  • MIC는 추론 시 오버헤드를 방지하기 위해 학습 기간 동안만 적용되며, 파rameter나 계산 비용 증가 없이 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1안개 제거를 진폭 스펙트럼 복원과 위상 스펙트럼 보정으로 분리함으로써 dehazing 성능 향상을 이룰 수 있는가?
  • RQ2공간/주파수 도메인 간, 스케일 간, 스테이지 간 특징을 효과적으로 융합하여 표현 능력을 향상시킬 수 있는가?
  • RQ3다중 수준 특징 상호작용에서 유도된 적응형 콘텐츠 인식 필터가 특징 보정에 기여하는가?
  • RQ4스테이지 간 특징 간 상호정보 최소화가 중복을 줄이고 특징 보완성을 향상시키는가?
  • RQ5이단계 이중 도메인 아키텍처가 낮은 모델 복잡도로 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • MITNet은 벤치마크 데이터셋에서 PSNR가 40 dB 이상을 기록하여, 이는 최초로 달성한 성과로 최신 기술 수준의 성능을 입증한다.
  • 제거 실험 결과, ATIM과 MIC를 함께 사용할 경우 기준 모델 대비 PSNR가 1.77 dB 향상되어 그 효과를 확인한다.
  • ATIM 또는 MIC를 제거하면 결과에 눈에 띄는 질감 및 대비 오차가 발생함으로써, 이들이 특징 품질 향상에 핵심적인 역할을 한다는 것을 시사한다.
  • 시각화 결과, MIC는 특징 맵 간의 보완성과 겹침을 줄여 중복을 감소시킴을 보여주며, 이는 효과적인 특징 정제를 의미한다.
  • 모델은 낮은 복잡도와 빠른 추론 속도를 유지하며, MIC는 추론 시에 추가 파rameter나 계산 비용을 유발하지 않는다.
  • 히스토그램과 특징 시각화 결과, MITNet은 조명, 색상, 질감 분포 측면에서 클리어 이미지에 더 가까운 출력을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.