Skip to main content
QUICK REVIEW

[論文レビュー] Learned Variable-Rate Multi-Frequency Image Compression using Modulated Generalized Octave Convolution

Jianping Lin, Mohammad Akbari|arXiv (Cornell University)|Sep 25, 2020
Advanced Data Compression Techniques参考文献 8被引用数 4
ひとこと要約

本稿では、変動するビットレートをサポートするための学習済み可変レート画像符号化フレームワークを提案する。この手法は、変調された一般化オクターブ畳み込み(M-GoConv)を用い、潜在的特徴量を高周波成分と低周波成分に分離することで、多スケール表現を効率的に実現する。ラグランジュ乗数λに条件づけられたネットワークにより、再訓練を必要とせず、わずか3つのモデルで広いビットレート範囲において高いレート-歪み性能を達成しており、Y-MS-SSIMではVVCを上回り、YUV-PSNRではBPGと同等の性能を示す。

ABSTRACT

In this proposal, we design a learned multi-frequency image compression approach that uses generalized octave convolutions to factorize the latent representations into high-frequency (HF) and low-frequency (LF) components, and the LF components have lower resolution than HF components, which can improve the rate-distortion performance, similar to wavelet transform. Moreover, compared to the original octave convolution, the proposed generalized octave convolution (GoConv) and octave transposed-convolution (GoTConv) with internal activation layers preserve more spatial structure of the information, and enable more effective filtering between the HF and LF components, which further improve the performance. In addition, we develop a variable-rate scheme using the Lagrangian parameter to modulate all the internal feature maps in the auto-encoder, which allows the scheme to achieve the large bitrate range of the JPEG AI with only three models. Experiments show that the proposed scheme achieves much better Y MS-SSIM than VVC. In terms of YUV PSNR, our scheme is very similar to HEVC.

研究の動機と目的

  • 再訓練を必要とせず、広いビットレート範囲にわたる可変レート符号化を実現する深層学習ベースの画像符号化手法の開発。
  • 一般化オクターブ畳み込みを用いて潜在的表現を高周波成分と低周波成分に因子分解することで、レート-歪み性能の向上。
  • 1つのラグランジュ乗数λによる内部特徴マップの変調を可能にし、レート制御を実現する、エンドツーエンドの効率的学習を可能にする。
  • BPG や VVC と同等の高い性能を達成しながら、エンコード/デコードの遅延を低く保つこと。

提案手法

  • 本手法は、特徴マップを高周波(HF)成分と低周波(LF)成分に分割する、変調された一般化オクターブ畳み込み(M-GoConv)および逆畳み込み(M-GoTConv)層を採用しており、LFマップは空間的解像度を半分に減らす。
  • 内部特徴マップは、学習可能なスケーリングネットワークによりスケーリングされ、ラグランジュ乗数λからチャネルごとの変調係数にマッピングされ、レート制御が可能になる。
  • ネットワークは一様なアーキテクチャを採用し、パラメータを1セットに統一しており、λを用いてすべての内部畳み込みを条件づけることで、可変レート動作を実現する。
  • モデルは、レートと歪みの加重和を最小化するマルチレートR-D目的関数により学習され、歪みは0.9×RGB-MSE + 0.1×(1−Y-MS-SSIM)として測定される。
  • エントロピー符号化は、学習済みハイパーピリオドを用いて潜在的表現に適用され、ビットストリームレートはガウス分布および一様量子化モデルにより計算される。
  • JPEG-AI CfE 標準の全ビットレート範囲をカバーするため、異なるλセットを用いて3つの別々のモデルを学習し、すべてのターゲットレートで正確なビットレート制御を実現する。

実験結果

リサーチクエスチョン

  • RQ11つの学習済みオートエンコーダアーキテクチャが、再トレーニングや複数モデルを必要とせず、広いビットレート範囲にわたる可変レート画像符号化を達成できるか?
  • RQ2λに変調された特徴マップスケーリングを伴う一般化オクターブ畳み込みを用いることで、標準畳み込みネットワークに比べて、レート-歪み性能がどのように向上するか?
  • RQ3同等の条件下で、本手法がVVCおよびBPGをどれほど上回るか、特にY-MS-SSIMおよびYUV-PSNRの観点から。
  • RQ4ラグランジュ乗数λが、多様な画像コンテンツにわたる正確なビットレート制御を実現するために、内部層を効果的に条件づけることができるか?
  • RQ5本多周波数・多レートフレームワークにおいて、モデルの複雑さ、エンコード/デコード速度、符号化性能の間にはどのようなトレードオフが生じるか?

主な発見

  • 提案手法は、高ビットレート域において、VVCテストモデル(VTM)に比べて最大で5 dB高いY-MS-SSIMを達成し、構造的類似性において顕著に優れている。
  • YUV-PSNRにおいて、複数のテスト画像でBPGと同等の性能を示しており、高い忠実度を実現している。
  • 適切なλ値を選択することで、訓練データセット外のレートに対しても、全ターゲットレートで1%以内のビットレート誤差を達成している。
  • 1944×1296解像度の画像について、CPU上ではエンコードが15秒、デコードが21秒であり、GPU上では10秒未満で実行され、高い効率性を示している。
  • JPEG-AI CfE 標準の全ビットレート範囲をカバーするため、わずか3つのモデルで十分であり、優れた一般化性とスケーラビリティを示している。
  • 変調された一般化オクターブ畳み込みの使用により、標準的なオクターブ畳み込みに比べて空間的構造をよりよく保持できており、再構成品質の向上に寄与している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。