Skip to main content
QUICK REVIEW

[논문 리뷰] The Devil Is in the Details: Window-based Attention for Image Compression

Renjie Zou, Chunfeng Song|arXiv (Cornell University)|2022. 03. 16.
Advanced Data Compression Techniques인용 수 8
한 줄 요약

이 논문은 비재귀적 문양 재구성 능력이 떨어지는 CNN의 한계를 보완하기 위해 국소 문양 재구성을 향상시키기 위해 윈도우 기반 로컬 어텐션 메커니즘을 제안한다. 이 방법은 CNN 및 트랜스포머 아키텍처에 원활하게 통합되며, 특히 MS-SSIM 최적화 하에서 상태최저 성능을 기록하며 시각적 품질과 세부 정보 유지 측면에서 뚜렷한 향상을 이룬다.

ABSTRACT

Learned image compression methods have exhibited superior rate-distortion performance than classical image compression standards. Most existing learned image compression models are based on Convolutional Neural Networks (CNNs). Despite great contributions, a main drawback of CNN based model is that its structure is not designed for capturing local redundancy, especially the non-repetitive textures, which severely affects the reconstruction quality. Therefore, how to make full use of both global structure and local texture becomes the core problem for learning-based image compression. Inspired by recent progresses of Vision Transformer (ViT) and Swin Transformer, we found that combining the local-aware attention mechanism with the global-related feature learning could meet the expectation in image compression. In this paper, we first extensively study the effects of multiple kinds of attention mechanisms for local features learning, then introduce a more straightforward yet effective window-based local attention block. The proposed window-based attention is very flexible which could work as a plug-and-play component to enhance CNN and Transformer models. Moreover, we propose a novel Symmetrical TransFormer (STF) framework with absolute transformer blocks in the down-sampling encoder and up-sampling decoder. Extensive experimental evaluations have shown that the proposed method is effective and outperforms the state-of-the-art methods. The code is publicly available at https://github.com/Googolxx/STF.

연구 동기 및 목표

  • CNN 기반 학습된 이미지 압축의 비재귀적 국소 문양 재구성 능력에 내재된 한계를 해결한다.
  • 이미지 압축 작업에서 국소 인지 어텐션 메커니즘이 전역 어텐션보다 우월한지 조사한다.
  • CNN 및 트랜스포머 기반 압축 모델 모두를 향상시킬 수 있는 유연하고 플러그 앤 플레이 형식의 어텐션 모듈을 설계한다.
  • 에코더와 디코더에 동일한 절대 트랜스포머 블록을 갖춘 새로운 대칭 트랜스포머(STF) 프레임워크를 개발하여 재구성 정밀도를 향상시킨다.
  • PSNR나 MS-SSIM 지표에만 의존하지 않고도 고대비 및 세부 영역에 더 나은 비트 할당을 가능하게 하여 인지 품질을 향상시킨다.

제안 방법

  • 국소 공간 윈도우 내에서 자기 어텐션을 계산하는 윈도우 기반 어텐션 메커니즘(WAM)을 제안하여 단기적 공간 상관관계를 포착한다.
  • 기존 CNN 및 트랜스포머 아키텍처, 특히 STF 프레임워크에 WAM을 플러그인 모듈로 통합한다.
  • 에코더와 디코더에 동일한 절대 트랜스포머 블록을 갖춘 대칭 트랜스포머(STF)를 설계하여 대칭적 특징 학습을 실현한다.
  • 고정된 공간 윈도우 내에서 채널별 멀티헤드 자기 어텐션을 사용하여 국소 문양 세부 정보를 유지하면서도 계산 효율성을 확보한다.
  • 효율적인 비트스트림 코딩을 위해 SGM 기반 엔트로피 모델을 적용하고, 트랜스포머 블록에 레이어 정규화를 사용한다.
  • MSE 및 MS-SSIM 최적화를 위한 하이퍼파rameter를 조정하여 비율-왜곡 손실을 사용해 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1전역 어텐션과 비교해 볼 때, 국소 인지 어텐션 메커니즘은 학습된 이미지 압축에서 비재귀적 문양 재구성에 있어 성능을 향상시킬 수 있는가?
  • RQ2비율-왜곡 및 시각적 품질 측면에서 윈도우 기반 어텐션 메커니즘은 비국소 어텐션과 비교해 어떻게 성능을 냈는가?
  • RQ3윈도우 기반 어텐션 모듈은 CNN 및 트랜스포머 기반 압축 모델에 얼마나 일반화되고 통합될 수 있는가?
  • RQ4대칭 트랜스포머 블록을 갖춘 제안된 대칭 트랜스포머(STF) 프레임워크는 비대칭 또는 표준 트랜스포머 설계보다 재구성 정밀도를 향상시키는가?
  • RQ5MSE와 MS-SSIM 최적화 목표에 따라 제안된 방법의 성능은 인지 품질 측면에서 어떻게 변화하는가?

주요 결과

  • λ=0.0035일 때, 기준 CNN 모델(Minnen2020) 대비 WAM은 PSNR를 0.16 dB 향상시키고 bpp를 0.003 감소시켰다.
  • λ=0.0130일 때, WAM이 통합된 모델은 34.10 dB의 PSNR와 0.448 bpp를 기록하여 기준 모델(33.87 dB, 0.454 bpp)과 비국소 어텐션 변형(33.95 dB, 0.467 bpp)을 모두 초월했다.
  • 윈도우 어텐션을 적용한 STF 모델은 텍스트 및 에지와 같은 고대비 영역에서 특히 뛰어난 시각적 품질을 보이며 정성적 비교에서 확인되었다.
  • 제거 실험 결과, WAM은 다양한 λ 값에서 일관되게 성능 향상을 보이며 그 강건성과 효과성을 입증했다.
  • 제안된 방법은 비율-왜곡 성능에서 최신 기술 수준을 확보하였으며, 특히 MS-SSIM 최적화 하에서 뚜렷한 향상으로 더 나은 인지 품질을 보여주었다.
  • 윈도우 기반 어텐션 메커니즘은 CNN 및 트랜스포머 아키텍처 모두와 호환되며, 플러그 앤 플레이 구성 요소로서 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.