Skip to main content
QUICK REVIEW

[論文レビュー] Image Compression with Product Quantized Masked Image Modeling

Alaaeldin El-Nouby, Matthew J. Muckley|arXiv (Cornell University)|Dec 14, 2022
Advanced Image Processing Techniques被引用数 12
ひとこと要約

この論文は、積量子化(product quantization)とマスク画像モデリングを組み合わせることで、最先端のレート・ディストーション性能を達成する画像圧縮フレームワーク、PQ-MIMを提案する。スカラー量子化を積量子化に置き換え、潜在表現の空間的依存性を捉えるためのトランスフォーマー基盤の条件付きエントロピー・モデルを用いることで、HiFiCと比較して競争力あるPSNRと優れた知覚的品質(FID、KID)を達成するとともに、微調整なしにハイブリッド圧縮・生成処理を可能にする。

ABSTRACT

Recent neural compression methods have been based on the popular hyperprior framework. It relies on Scalar Quantization and offers a very strong compression performance. This contrasts from recent advances in image generation and representation learning, where Vector Quantization is more commonly employed. In this work, we attempt to bring these lines of research closer by revisiting vector quantization for image compression. We build upon the VQ-VAE framework and introduce several modifications. First, we replace the vanilla vector quantizer by a product quantizer. This intermediate solution between vector and scalar quantization allows for a much wider set of rate-distortion points: It implicitly defines high-quality quantizers that would otherwise require intractably large codebooks. Second, inspired by the success of Masked Image Modeling (MIM) in the context of self-supervised learning and generative image models, we propose a novel conditional entropy model which improves entropy coding by modelling the co-dependencies of the quantized latent codes. The resulting PQ-MIM model is surprisingly effective: its compression performance on par with recent hyperprior methods. It also outperforms HiFiC in terms of FID and KID metrics when optimized with perceptual losses (e.g. adversarial). Finally, since PQ-MIM is compatible with image generation frameworks, we show qualitatively that it can operate under a hybrid mode between compression and generation, with no further training or finetuning. As a result, we explore the extreme compression regime where an image is compressed into 200 bytes, i.e., less than a tweet.

研究の動機と目的

  • ベクトル量子化とマスク画像モデリングを統合することで、ニューラル画像圧縮と画像生成の間の手法的ギャップを埋めること。
  • スカラー量子化の制限を克服し、スケーラブルなレート・ディストーション性能を実現するため、積量子化を導入すること。
  • マスク画像モデリングを用いて量子化された潜在表現内の空間的依存性をモデル化することで、エントロピー符号化コストを低減すること。
  • 追加の訓練なしに、モデルの生成能力を活用してハイブリッド圧縮・生成モードを実現すること。

提案手法

  • VQ-VAEにおける標準的なベクトル量子化を積量子化(PQ)に置き換え、効率的なコードブック学習を可能にすることで、広い範囲のレート・ディストーショントレードオフを実現すること。
  • 各段階で徐々に観測されたパッチが増えるように条件づけられるマルチステージのマスク画像モデリング(MIM)フレームワークを設計し、条件付きエントロピーを低減すること。
  • 視覚変換器を用いて潜在表現の条件付き分布を推定し、エンコーダーとデコーダーの両方で対称的にエントロピー符号化に適用すること。
  • 四の字型または信頼度ベースのパッチマスキングポリシーを適用し、各段階でどのパッチを観測対象とするかを決定することで、レート削減を最適化すること。
  • 再構成損失、知覚的損失、敵対的損失の組み合わせでモデルを訓練し、視覚的品質を向上させること。
  • MIMモデルを再利用して欠損パッチの補完を行うことで、画像生成と統合可能なハイブリッド動作を実現すること。

実験結果

リサーチクエスチョン

  • RQ1VQ-VAEフレームワークにおける積量子化は、ニューラル画像圧縮におけるスカラー量子化の代替手段として、スケーラブルかつ効果的であると言えるか?
  • RQ2空間的依存性を活用することで、マスク画像モデリングをどのように潜在空間におけるエントロピー符号化の改善に適応できるか?
  • RQ3知覚的目的で訓練された圧縮モデルは、FIDおよびKID指標において、既存のベースラインをどの程度上回ることができるか?
  • RQ4微調整なしに、1つのモデルが圧縮モードと生成モードの両方で効果的に動作できるか?
  • RQ50.6ビット/ピクセル未満の極端な圧縮領域において、モデルの効果性はどの程度か?

主な発見

  • PQ-MIMは、ハイパーピリオド法を含む強力なニューラル圧縮ベースラインと比較して、競争力あるPSNRおよびMS-SSIM性能を達成している。
  • 知覚的損失および敵対的損失で訓練した場合、PQ-MIMはFIDおよびKID指標においてHiFiCを上回り、優れた知覚的品質を示している。
  • MIMに基づくエントロピーモデリングにより、ビットレートが顕著に削減され、四の字型マスキングポリシーでは5ステップ程度の段階でも強いレート削減効果を示している。
  • PQ-MIMは強力なインpainting能力を示し、最大50%のパッチ欠損に対しても、構造的および意味的詳細を保持した再構成が可能である。
  • 追加の訓練なしに、ハイブリッド圧縮・生成モードで動作し、欠損または損傷したパッチの再構成が可能である。
  • モデル容量をXCiT-T6(3.5Mパラメータ)からXCiT-L6(47Mパラメータ)に増加させることで、PSNRが約+0.8 dB向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。