Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Octave Convolutions for Learned Multi-Frequency Image Compression

Mohammad Akbari, Jie Liang|arXiv (Cornell University)|Feb 24, 2020
Advanced Data Compression Techniques参考文献 30被引用数 21
ひとこと要約

本論文は、潜在表現を高周波成分と低周波成分に分解することで、学習可能なマルチ周波数画像圧縮を可能にする一般化されたオクターブ畳み込み(GoConv/GoTConv)を提案する。低周波成分は空間冗長性を低減するため、低解像度で保存される。本手法はKodakデータセットで最先端のrate-distortion性能を達成し、VVC(4:2:0)をPSNRおよびMS-SSIMの両面で上回る。また、画像分類および画像ノイズ除去タスクにおいても性能向上を示す。

ABSTRACT

Learned image compression has recently shown the potential to outperform the standard codecs. State-of-the-art rate-distortion (R-D) performance has been achieved by context-adaptive entropy coding approaches in which hyperprior and autoregressive models are jointly utilized to effectively capture the spatial dependencies in the latent representations. However, the latents are feature maps of the same spatial resolution in previous works, which contain some redundancies that affect the R-D performance. In this paper, we propose the first learned multi-frequency image compression and entropy coding approach that is based on the recently developed octave convolutions to factorize the latents into high and low frequency (resolution) components, where the low frequency is represented by a lower resolution. Therefore, its spatial redundancy is reduced, which improves the R-D performance. Novel generalized octave convolution and octave transposed-convolution architectures with internal activation layers are also proposed to preserve more spatial structure of the information. Experimental results show that the proposed scheme not only outperforms all existing learned methods as well as standard codecs such as the next-generation video coding standard VVC (4:2:0) on the Kodak dataset in both PSNR and MS-SSIM. We also show that the proposed generalized octave convolution can improve the performance of other auto-encoder-based computer vision tasks such as semantic segmentation and image denoising.

研究の動機と目的

  • 学習可能な画像圧縮における空間冗長性を軽減するため、潜在表現を高周波成分と低周波成分に分解する。
  • ウェーブレット変換に類似した方法で、低周波成分を低空間解像度で表現することで冗長性を低減する。
  • 深層オートエナボーダーに基づく圧縮フレームワークにおいて、周波数に敏感な特徴分解を活用してrate-distortion性能を向上させる。
  • マルチ周波数処理中に空間構造を保持することができる、新しい一般化されたオクターブ畳み込みおよび転置畳み込みアーキテクチャを構築する。
  • GoConv/GoTConvの広範な有用性を、画像圧縮以外のタスク、例えば画像ノイズ除去およびセマンティックセグメンテーションにおいても示す。

提案手法

  • マルチ周波数特徴分解中の空間構造をよりよく保持できるよう、内部活性化層を備えた一般化されたオクターブ畳み込み(GoConv)およびオクターブ転置畳み込み(GoTConv)を提案する。
  • エンコーダーにGoConvを適用し、潜在特徴マップを高周波成分(HF)と低周波成分(LF)に分解する。この際、LF成分は低解像度にダウンサンプリングされる。
  • デコーダーでGoTConvを用いて、HFおよびLF成分からフル解像度の画像を再構築する。これにより、周波数間の効果的な通信が可能になる。
  • ハイパープライアと自己回帰モデルを用いた文脈適応型エントロピー符号化を組み合わせ、マルチ周波数潜在表現を学習可能な圧縮フレームワークに統合する。
  • エントロピー・モデルをハイパープライアおよび自己回帰的文脈モデリングに条件づけた、joint rate-distortion目的関数を用いて、システム全体をエンドツーエンドで最適化する。
  • 微分可能なレート制御を実現するため、ソフトからハードへのベクトル量子化アプローチを採用し、スケーリングにより可変レート動作を可能にする。

実験結果

リサーチクエスチョン

  • RQ1潜在表現のマルチ周波数分解は、学習可能な画像圧縮における空間冗長性を低減し、rate-distortion性能を向上させることができるか?
  • RQ2オクターブ畳み込みをどのように一般化すれば、空間構造を保持しつつ、特徴の効率的なマルチスケール表現を実現できるか?
  • RQ3提案されたマルチ周波数圧縮フレームワークは、PSNRおよびMS-SSIMの観点から、VVCなどの既存の学習済みおよび標準コーデックをどの程度上回るか?
  • RQ4提案されたGoConv/GoTConvアーキテクチャは、画像圧縮以外のCNNベースのビジョンタスクにおいても性能向上をもたらすか?
  • RQ5標準的な畳み込みオートエナボーダと比較して、マルチ周波数因子分解はモデル効率(パラメータ数およびFLOPs)にどのような影響を与えるか?

主な発見

  • 提案手法はKodakデータセットで最先端のrate-distortion性能を達成し、VVC(4:2:0)および先行する学習済み圧縮手法の両方をPSNRおよびMS-SSIMの両面で上回る。
  • Kodakデータセットにおいて、0.25 bppでPSNR 32.18 dB、MS-SSIM 0.952を達成し、VVC(4:2:0)およびすべての先行する学習済み圧縮手法を上回る。
  • 画像ノイズ除去タスクでは、GoConv/GoTConvを搭載したマルチ周波数オートエナボーダがCIFAR10でPSNR 23.54 dBを達成し、ヴァニラ畳み込みを用いたベースラインより0.25 dBの向上を示す。
  • 提案モデルは、ベースラインオートエナボーダと比較して、パラメータ数を5.3%削減し、FLOPsを17.5%削減しながら、性能を維持または向上させる。
  • 一般化されたオクターブ畳み込みアーキテクチャは、CityscapesセマンティックセグメンテーションベンチマークでmIoUを0.013向上させ、圧縮以外の応用分野への汎用性を示している。
  • 本手法は高周波成分と低周波成分間の効果的な通信を可能にし、構造的忠実性を損なわず、再構築品質を向上させるとともに冗長性を低減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。