Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Image Super-Resolution with Feature Interaction Weighted Hybrid Network

Wenjie Li, Juncheng Li|arXiv (Cornell University)|2022. 12. 29.
Advanced Image Processing Techniques인용 수 5
한 줄 요약

이 논문은 특징 상호작용 메커니즘을 갖춘 새로운 넓은 잔차 증류 상호작용 블록(WDIB)을 통해 CNN과 Transformer 구성요소를 융합한 경량이며 효율적인 이미지 초해상도 네트워크인 특징 상호작용 가중 혼합 네트워크(FIWHN)를 제안한다. 넓은 컨볼루션과 동일 잔차 가중치 단위, 자기 校정 융합, 특징 셔플 가중 그룹을 활용함으로써 FIWHN은 중간 특징 손실을 감소시키고, 더 낮은 FLOPs와 파rameter 수로 최신 기술 성능을 달성하며, DIV2K 및 RealSR을 포함한 벤치마크에서 이전 방법들을 능가한다.

ABSTRACT

Lightweight image super-resolution aims to reconstruct high-resolution images from low-resolution images using low computational costs. However, existing methods result in the loss of middle-layer features due to activation functions. To minimize the impact of intermediate feature loss on reconstruction quality, we propose a Feature Interaction Weighted Hybrid Network (FIWHN), which comprises a series of Wide-residual Distillation Interaction Block (WDIB) as the backbone. Every third WDIB forms a Feature Shuffle Weighted Group (FSWG) by applying mutual information shuffle and fusion. Moreover, to mitigate the negative effects of intermediate feature loss, we introduce Wide Residual Weighting units within WDIB. These units effectively fuse features of varying levels of detail through a Wide-residual Distillation Connection (WRDC) and a Self-Calibrating Fusion (SCF). To compensate for global feature deficiencies, we incorporate a Transformer and explore a novel architecture to combine CNN and Transformer. We show that our FIWHN achieves a favorable balance between performance and efficiency through extensive experiments on low-level and high-level tasks. Codes will be available at \url{https://github.com/IVIPLab/FIWHN}.

연구 동기 및 목표

  • 기존의 딥 러닝 기반 단일 이미지 초해상도(SISR) 방법에서 발생하는 높은 계산 비용과 중간 특징 손실 문제를 해결하기 위해.
  • 딥 네트워크에서 활성화 함수에 의해 유발되는 특징 손실을 줄이면서도 모델의 효율성을 유지하기 위해.
  • 하이브리드 CNN-Transformer 아키텍처를 통해 다중 척도 및 전역 특징을 융합하여 특징 표현을 향상시키기 위해.
  • 모델 크기와 FLOPs를 최소화하여 자원 제약이 있는 장치에 효과적으로 구현 가능하게 하기 위해.
  • 향상된 이미지 재구성으로 인해 세분화 분류 및 얼굴 인식과 같은 후행 비전 작업의 성능을 향상시키기 위해.

제안 방법

  • 격자 구조의 넓은 잔차 블록과 주목적 기반 스킵 연결을 조합한 핵심 구성 단위로 넓은 잔차 증류 상호작용 블록(WDIBs)을 제안한다.
  • 활성화 이전에 중간 특징를 유지하고 보완하기 위해 넓은 컨volution 레이어 기반의 잔차 가중치 단위(WCRW)와 동일한 잔차 가중치 단위(WIRW)를 도입한다.
  • 분할된 특징 증류와 점프 연결을 포함한 넓은 잔차 증류 연결(WRDC) 프레임워크를 활용하여 특징 융합과 일반화 능력을 향상시킨다.
  • 다양한 정제 수준의 특징을 동적으로 가중하고 융합하기 위해 자기 캘리브레이션 융합(SCF) 유닛을 설계한다.
  • 매 3개의 WDIB마다 특징을 혼합하고 재가중하여 그룹 수준의 특징 상호작용을 강화하는 특징 셔플 가중 그룹(FSWGs)을 구성한다.
  • 장거리 의존성을 포착하고 국소 CNN 표현을 보완하기 위해 CNN 백본에 경량 Transformer 모듈을 통합한다.

실험 결과

연구 질문

  • RQ1하이브리드 CNN-Transformer 아키텍처가 계산 비용을 줄이고도 뛰어난 SISR 성능을 달성할 수 있는가?
  • RQ2딥 잔차 네트워크에서 ReLU 활성화에 의해 발생하는 중간 특징 손실은 어떻게 완화할 수 있는가?
  • RQ3다른 수준의 표현에서의 특징 상호작용과 크로스 융합은 재구성 품질 향상과 모델 일반화 능력을 향상시킬 수 있는가?
  • RQ4제안된 아키텍처는 실제 세계 및 벤치마크 데이터셋에서 기존의 경량 SISR 모델보다 얼마나 뛰어나게 성능을 냈는가?
  • RQ5FIWHN에서 향상된 이미지 재구성은 세분화 분류 및 얼굴 인식과 같은 후행 비전 작업의 성능 향상에 기여하는가?

주요 결과

  • ×2 스케일에서 RealSR 데이터셋에서 FIWHN은 PSNR 33.96 dB, SSIM 0.927를 기록하여, ×3 스케일에서 두 번째로 우수한 성능을 보인 ESRT보다 0.19 dB 높은 성능을 달성한다.
  • DIV2K 데이터셋에서 FIWHN은 ×4 스케일에서 PSNR 34.01 dB, SSIM 0.937을 기록하여 최신 기술 수준의 성능을 입증한다.
  • EDSR 대비 FLOPs는 30% 감소하고 파라미터 수는 25% 감소하여, 단일 NVIDIA RTX 2080Ti GPU에서 학습이 가능해졌으며, 이는 이전의 다른 모델들이 이중 GPU가 필요로 했던 것과 대비된다.
  • 시각적 비교 결과 FIWHN은 FDIWN과 Bicubic에 비해 더 섬세한 질감과 더 선명한 윤곽을 복원하며, 잡음과 왜곡을 줄이고 참값(HR ground truth)에 더 가까운 결과를 보였다.
  • CamVid에서의 세분화 분류 작업에서 FIWHN으로 재구성된 이미지는 특히 유도체 기둥과 같은 미세한 구조물에 대해 참값에 더 가까운 결과를 도출했다.
  • 얼굴 초해상도 및 실제 세계 초해상도 벤치마크에서 뛰어난 성능을 기록하여, 다양한 이미지 분포에 걸쳐 높은 강건성과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.