Skip to main content
QUICK REVIEW

[論文レビュー] Compression with Bayesian Implicit Neural Representations

Zongyu Guo, Gergely Flamich|arXiv (Cornell University)|May 30, 2023
Advanced Data Compression Techniques被引用数 6
ひとこと要約

この論文では、変分ベイジアン暗黙的ニューラル表現(INRs)を用いて、レート・歪み最適化を統合的に実現する、モダリティに依存しないニューラル圧縮手法COMBINERを提案する。重みを変分事後分布からサンプリングし、相対エントロピー符号化によって圧縮することで、$β$-ELBOを直接最適化し、メタラーニングループを必要とせず、画像および音声データにおいて優れた性能を達成する。

ABSTRACT

Many common types of data can be represented as functions that map coordinates to signal values, such as pixel locations to RGB values in the case of an image. Based on this view, data can be compressed by overfitting a compact neural network to its functional representation and then encoding the network weights. However, most current solutions for this are inefficient, as quantization to low-bit precision substantially degrades the reconstruction quality. To address this issue, we propose overfitting variational Bayesian neural networks to the data and compressing an approximate posterior weight sample using relative entropy coding instead of quantizing and entropy coding it. This strategy enables direct optimization of the rate-distortion performance by minimizing the $β$-ELBO, and target different rate-distortion trade-offs for a given network architecture by adjusting $β$. Moreover, we introduce an iterative algorithm for learning prior weight distributions and employ a progressive refinement process for the variational posterior that significantly enhances performance. Experiments show that our method achieves strong performance on image and audio compression while retaining simplicity.

研究の動機と目的

  • 固定精度量子化に依存し、エンドツーエンドのレート・歪み最適化を欠く既存のINRベース圧縮手法の性能ギャップを是正すること。
  • 変分ベイジアン推論を活用して、暗黙的ニューラル表現におけるレートと歪みの共同最適化を実現すること。
  • 再構成品質を損なわず、圧縮効率を向上させるために、適応的パラメータプルーニングおよび活性化を可能にする手法を開発すること。
  • INR圧縮における固定精度量子化の制限を克服し、事後分布サンプルの相対エントロピー符号化を用いること。
  • モダリティ固有のアーキテクチャチューニングなしに、画像および音声データに一般化可能な、シンプルで効果的なフレームワークを設計すること。

提案手法

  • データに合わせて、INR重み上の変分事後分布$q_{\mathbf{w}}$をフィットさせ、点推定の代わりに確率的表現を導入する。
  • サンプルされた重みベクトル$\mathbf{w}^* \sim q_{\mathbf{w}}$を相対エントロピー符号化(REC)で圧縮し、その期待コストがKLダイバージェンス$D_{\mathrm{KL}}[q_{\mathbf{w}}\|p_{\mathbf{w}}]$を近似する。
  • $β$を調整することで$β$-ELBO目的関数を最小化し、直接的にレート・歪みトレードオフを最適化する。
  • ネットワーク重み上での最適な事前分布$p_{\mathbf{w}}$を学習するための反復的アルゴリズムを提案する。
  • 重みをブロックに分割し、順次圧縮・微調整することで、事後分布の正確性を向上させる段階的精錬戦略を実装する。
  • 各ブロックの符号化後に残りの未圧縮重みの事後分布を勾配降下法で改善することで、全体の再構成忠実度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1固定精度量子化と比較して、変分ベイジアン推論はINRベース圧縮におけるレート・歪み性能を向上させ得るか?
  • RQ2INR重み上での事前分布の学習が、データモダリティにわたる圧縮性能と一般化能力に与える影響は何か?
  • RQ3変分事後分布の段階的精錬が、再構成品質およびレート・歪みトレードオフにどの程度寄与するか?
  • RQ4モダリティ固有の設計を必要とせず、単純でエンドツーエンドでトレーニング可能なINRベース圧縮フレームワークは、複雑なメタラーニングベースのベースラインを上回る性能を発揮できるか?
  • RQ5反復的事後分布精錬および事前分布学習が、画像および音声圧縮におけるPSNRおよびビットレート効率に与える影響は何か?

主な発見

  • COMBINERは、CIFAR-10、Kodak、LibriSpeechデータセットにおいて、そのシンプルさにもかかわらず、既存のINRベース手法を上回る優れた圧縮性能を達成する。
  • 段階的精錬および反復的事前分布学習技術により、低解像度画像圧縮タスクでPSNRが4 dB以上向上する。
  • 1台のA100 GPUで500枚のCIFAR-10画像を圧縮するには、ビットレートに応じて13〜34分程度かかり、その大部分は事後分布推論と微調整に費やされる。
  • 復号は非常に効率的である:GPU上での1枚のCIFAR-10画像再構成には2〜4 ms、CPU上でのKodak画像では1秒未満で完了する。
  • 3,000ステップを超えて微調整を継続しても効果は薄く、30,000ステップでは3,000ステップと比較してPSNRが0.3 dB僅かに向上するが、処理時間は90%増加する。
  • COMBINERは、最先端のINRコデッカーで用いられるメタラーニングループの必要性を排除し、データをチャンクに分割せず、フル画像およびフルオーディオINR学習を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。