Skip to main content
QUICK REVIEW

[논문 리뷰] Image Compression with Product Quantized Masked Image Modeling

Alaaeldin El-Nouby, Matthew J. Muckley|arXiv (Cornell University)|2022. 12. 14.
Advanced Image Processing Techniques인용 수 12
한 줄 요약

이 논문은 상태의 성능을 달성하기 위해 제품 퀀티제이션과 마스킹 이미지 모델링을 결합한 새로운 이미지 압축 프레임워크인 PQ-MIM을 제안한다. 스칼라 퀀티제이션 대신 제품 퀀티제이션을 사용하고, 잠재 코드의 공간적 의존성을 활용하기 위해 트랜스포머 기반 조건부 엔트로피 모델을 적용함으로써, HiFiC에 비해 경쟁적인 PSNR와 뛰어난 시각적 품질(FID, KID)을 달성하면서도, 추가 트레이닝 없이 하이브리드 압축-생성 기능을 지원한다.

ABSTRACT

Recent neural compression methods have been based on the popular hyperprior framework. It relies on Scalar Quantization and offers a very strong compression performance. This contrasts from recent advances in image generation and representation learning, where Vector Quantization is more commonly employed. In this work, we attempt to bring these lines of research closer by revisiting vector quantization for image compression. We build upon the VQ-VAE framework and introduce several modifications. First, we replace the vanilla vector quantizer by a product quantizer. This intermediate solution between vector and scalar quantization allows for a much wider set of rate-distortion points: It implicitly defines high-quality quantizers that would otherwise require intractably large codebooks. Second, inspired by the success of Masked Image Modeling (MIM) in the context of self-supervised learning and generative image models, we propose a novel conditional entropy model which improves entropy coding by modelling the co-dependencies of the quantized latent codes. The resulting PQ-MIM model is surprisingly effective: its compression performance on par with recent hyperprior methods. It also outperforms HiFiC in terms of FID and KID metrics when optimized with perceptual losses (e.g. adversarial). Finally, since PQ-MIM is compatible with image generation frameworks, we show qualitatively that it can operate under a hybrid mode between compression and generation, with no further training or finetuning. As a result, we explore the extreme compression regime where an image is compressed into 200 bytes, i.e., less than a tweet.

연구 동기 및 목표

  • 벡터 퀀티제이션과 마스킹 이미지 모델링을 통합하여 신경 이미지 압축과 이미지 생성 간의 방법론적 격차를 해소하기 위해.
  • 신경 압축에서 스칼라 퀀티제이션의 한계를 해결하기 위해 확장 가능한 비율-왜곡 성능을 제공하는 제품 퀀티제이션을 도입하기 위해.
  • 마스킹 이미지 모델링 접근법을 사용해 퀀티제이션된 잠재 코드의 공간적 의존성을 모델링함으로써 엔트로피 코딩 비용을 줄이기 위해.
  • 추가 학습 없이도 모델의 생성 능력을 활용하여 하이브리드 압축-생성 모드를 가능하게 하기 위해.

제안 방법

  • VQ-VAE에서 표준 벡터 퀀티제이션 대신 제품 퀀티제이션(PQ)을 도입하여 효율적인 코드북 학습을 통해 더 넓은 비율-왜곡 트레이드오프를 가능하게 하였다.
  • 각 단계에서 점점 더 많은 관측된 패치를 조건으로 삼는 다단계 마스킹 이미지 모델링(MIM) 프레임워크를 설계하여 조건부 엔트로피를 감소시켰다.
  • 잠재 코드의 조건부 분포를 추정하기 위해 비전 트랜스포머를 사용하였으며, 이는 인코더와 디코더 양쪽에 대칭적으로 적용되어 엔트로피 코딩에 활용되었다.
  • 쿼인쿠스 또는 신뢰도 기반 패치 마스킹 정책을 적용하여 각 단계에서 관측되는 패치를 결정함으로써 비트레이트 감소를 최적화하였다.
  • 시각적 품질 향상을 위해 복원 손실, 인지 손실, 그리고 적대적 손실의 조합으로 모델을 학습시켰다.
  • MIM 모델을 재사용하여 누락된 패치를 보정하는 인painting 작업을 수행함으로써, 이미지 생성과의 호환성을 입증함으로써 하이브리드 동작을 가능하게 하였다.

실험 결과

연구 질문

  • RQ1VQ-VAE 프레임워크 내에서 제품 퀀티제이션은 신경 이미지 압축에서 스칼라 퀀티제이션의 확장 가능한 효과적인 대안이 될 수 있는가?
  • RQ2공간적 의존성을 패치 간에 활용함으로써 마스킹 이미지 모델링을 어떻게 개선하여 잠재 공간의 엔트로피 코딩을 향상시킬 수 있는가?
  • RQ3인지 목표로 학습된 압축 모델이 FID 및 KID 지표 측면에서 기존 베이스라인을 얼마나 뛰어나게 성능을 내는가?
  • RQ4추가 트레이닝 없이도 단일 모델이 압축 및 생성 모드에서 효과적으로 작동할 수 있는가?
  • RQ50.6 비트/픽셀 이하의 극한 압축 환경에서 모델의 성능은 얼마나 효과적인가?

주요 결과

  • PQ-MIM는 하이퍼프리어 기반 강력한 신경 압축 베이스라인과 비교해도 경쟁적인 PSNR 및 MS-SSIM 성능을 달성하였다.
  • 인지 손실 및 적대적 손실로 학습된 PQ-MIM는 FID 및 KID 지표에서 HiFiC를 초월하여 뛰어난 시각적 품질을 보였다.
  • MIM 기반 엔트로피 모델링을 통해 비트레이트를 크게 감소시켰으며, 쿼인쿠스 마스킹 정책은 다섯 단계만으로도 뛰어난 레이트 절감 효과를 보였다.
  • PQ-MIM는 강력한 인painting 능력을 보였으며, 최대 50%의 패치가 누락된 경우에도 구조적 및 의미적 세부 정보를 유지한 채 이미지를 재구성할 수 있었다.
  • 추가 학습 없이도 하이브리드 압축-생성 모드로 작동하여 누락되거나 손상된 패치를 복구할 수 있었다.
  • 모델 용량을 XCiT-T6(350만 파라미터)에서 XCiT-L6(4700만 파라미터)로 증가시켰을 때 PSNR 성능이 약 +0.8 dB 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.