Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Octave Convolutions for Learned Multi-Frequency Image Compression

Mohammad Akbari, Jie Liang|arXiv (Cornell University)|2020. 02. 24.
Advanced Data Compression Techniques참고 문헌 30인용 수 21
한 줄 요약

이 논문은 잠재 표현을 고주파 및 저주파 성분으로 분해함으로써 학습된 다주파수 영상 압축을 가능하게 하는 일반화된 오크타브 컨볼루션(GoConv/GoTConv)을 제안한다. 이때 저주파 성분은 공간 중복성을 줄이기 위해 낮은 해상도로 저장된다. 이 방법은 Kodak 데이터셋에서 최신 기준 성능을 달성하며, VVC(4:2:0)보다 PSNR 및 MS-SSIM 모두에서 뛰어난 성능을 보이며, 동시에 세분화 및 영상 노이즈 제거 작업에서도 성능 향상을 이룬다.

ABSTRACT

Learned image compression has recently shown the potential to outperform the standard codecs. State-of-the-art rate-distortion (R-D) performance has been achieved by context-adaptive entropy coding approaches in which hyperprior and autoregressive models are jointly utilized to effectively capture the spatial dependencies in the latent representations. However, the latents are feature maps of the same spatial resolution in previous works, which contain some redundancies that affect the R-D performance. In this paper, we propose the first learned multi-frequency image compression and entropy coding approach that is based on the recently developed octave convolutions to factorize the latents into high and low frequency (resolution) components, where the low frequency is represented by a lower resolution. Therefore, its spatial redundancy is reduced, which improves the R-D performance. Novel generalized octave convolution and octave transposed-convolution architectures with internal activation layers are also proposed to preserve more spatial structure of the information. Experimental results show that the proposed scheme not only outperforms all existing learned methods as well as standard codecs such as the next-generation video coding standard VVC (4:2:0) on the Kodak dataset in both PSNR and MS-SSIM. We also show that the proposed generalized octave convolution can improve the performance of other auto-encoder-based computer vision tasks such as semantic segmentation and image denoising.

연구 동기 및 목표

  • 학습된 영상 압축에서 공간 중복성을 줄이기 위해 잠재 표현을 고주파 및 저주파 성분으로 분해하는 것.
  • 웨이브렛 변환과 유사하게 저주파 성분을 낮은 공간 해상도로 표현하여 중복성을 줄이는 것.
  • 깊이 신경망 기반 압축에서 주파수 인식 특징 분해를 활용해 비율-왜곡 성능을 향상시키는 것.
  • 다중 주파수 처리 중 공간 구조를 유지하는 새로운 일반화된 오크타브 컨볼루션 및 전치 컨볼루션 아키텍처를 개발하는 것.
  • GoConv/GoTConv의 보다 넓은 활용 가능성을 영상 노이즈 제거 및 세분화와 같은 비압축 작업에서 입증하는 것.

제안 방법

  • 다중 주파수 특징 분해 중 공간 구조를 더 잘 유지하기 위해 내부 활성화 레이어를 갖춘 일반화된 오크타브 컨볼루션(GoConv)과 오크타브 전치 컨볼루션(GoTConv)을 제안한다.
  • 엔코더에 GoConv를 적용하여 잠재 특징 맵을 고주파(HF) 및 저주파(LF) 성분으로 분해하며, 이때 LF 성분은 해상도를 낮춘다.
  • 디코더에서 GoTConv를 사용하여 HF 및 LF 성분으로부터 전체 해상도 영상을 재구성함으로써 효과적인 다중 주파수 간 통신을 가능하게 한다.
  • 하이퍼프리모델 및 자기상관 모델을 사용한 맥락 적응형 엔트로피 코딩을 통합하여 다중 주파수 잠재 표현을 학습된 압축 프레임워크에 통합한다.
  • 엔트로피 모델을 하이퍼프리모델 및 자기상관 맥락 모델에 조건화하여 전체 시스템을 비율-왜곡 목적 함수를 기반으로 종합적으로 최적화한다.
  • 다양한 비율 제어를 가능하게 하기 위해 소프트에서 하드로의 벡터 양자화 기법을 활용하고 스케일링을 통해 가변 비율 작동을 가능하게 한다.

실험 결과

연구 질문

  • RQ1잠재 표현의 다주파수 분해가 학습된 영상 압축에서 공간 중복성을 줄이고 비율-왜곡 성능을 향상시킬 수 있는가?
  • RQ2오크타브 컨볼루션은 특징의 다중 해상도 표현을 효율적으로 가능하게 하면서도 공간 구조를 유지하기 위해 어떻게 일반화될 수 있는가?
  • RQ3제안된 다주파수 압축 프레임워크는 PSNR 및 MS-SSIM 측면에서 기존의 학습 기반 압축기 및 표준 압축기인 VVC에 비해 어느 정도 뛰어나게 성능을 냈는가?
  • RQ4제안된 GoConv/GoTConv 아키텍처는 영상 압축을 넘어서 CNN 기반 비전 작업에서 성능 향상에 기여할 수 있는가?
  • RQ5표준 컨볼루션 오토에인코더에 비해 다주파수 분해가 모델 효율성(파rameter 수 및 FLOPs)에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 Kodak 데이터셋에서 최신 기준 비율-왜곡 성능을 달성하며, VVC(4:2:0) 및 이전의 학습 기반 압축 방법 모두를 PSNR 및 MS-SSIM 측면에서 능가한다.
  • Kodak 데이터셋에서 이 방법은 0.25 bpp에서 PSNR 32.18 dB 및 MS-SSIM 0.952를 기록하며, VVC(4:2:0) 및 모든 이전의 학습 기반 압축 방법을 초월한다.
  • 영상 노이즈 제거 작업에서 GoConv/GoTConv를 갖춘 다주파수 오토에인코더는 CIFAR10에서 PSNR 23.54 dB를 기록하며, 일반 컨볼루션을 사용한 베이스라인 대비 0.25 dB 향상된 성능을 보였다.
  • 제안된 모델은 기준 오토에인코더 대비 모델 파라미터를 5.3% 감소시키고 FLOPs를 17.5% 감소시키며, 성능은 유지하거나 향상시켰다.
  • 일반화된 오크타브 컨볼루션 아키텍처는 Cityscapes 세분화 벤치마크에서 mIoU를 0.013 향상시켜, 압축을 넘어서는 응용 가능성도 입증하였다.
  • 이 방법은 고주파 및 저주파 성분 간 효과적인 통신을 가능하게 하여 재구성 품질을 향상시키고, 구조적 정밀도를 손상시키지 않으면서 중복성을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.