Skip to main content
QUICK REVIEW

[論文レビュー] Learning Context-Based Non-local Entropy Modeling for Image Compression

Mu Li, Kai Zhang|arXiv (Cornell University)|May 10, 2020
Advanced Data Compression Techniques参考文献 46被引用数 5
ひとこと要約

本稿では、非局所注意ブロックを用いて潜在表現のグローバルな類似性を活用することで、レート・ドレステーション性能を向上させる、文脈に基づく非局所エントロピーモデリング手法を提案する。参照情報の欠落問題に対処するため、プロキシ類似度関数と空間マスクを導入し、マスク付き畳み込みネットワークにおける非局所注意機構を用いて局所的およびグローバルな文脈を統合することで、優れたエントロピー推定を実現する。さらに、変換部にU-Netに類似たブロックを採用することで、幅を効率的に拡大し、KodakおよびTecnickデータセットにおいて、特に低歪みレベルで最先端の性能を達成する。

ABSTRACT

The entropy of the codes usually serves as the rate loss in the recent learned lossy image compression methods. Precise estimation of the probabilistic distribution of the codes plays a vital role in the performance. However, existing deep learning based entropy modeling methods generally assume the latent codes are statistically independent or depend on some side information or local context, which fails to take the global similarity within the context into account and thus hinder the accurate entropy estimation. To address this issue, we propose a non-local operation for context modeling by employing the global similarity within the context. Specifically, we first introduce the proxy similarity functions and spatial masks to handle the missing reference problem in context modeling. Then, we combine the local and the global context via a non-local attention block and employ it in masked convolutional networks for entropy modeling. The entropy model is further adopted as the rate loss in a joint rate-distortion optimization to guide the training of the analysis transform and the synthesis transform network in transforming coding framework. Considering that the width of the transforms is essential in training low distortion models, we finally produce a U-Net block in the transforms to increase the width with manageable memory consumption and time complexity. Experiments on Kodak and Tecnick datasets demonstrate the superiority of the proposed context-based non-local attention block in entropy modeling and the U-Net block in low distortion compression against the existing image compression standards and recent deep image compression models.

研究の動機と目的

  • 従来のディープラーニングベースのエントロピーモデルが局所的または独立した文脈に依存するため、潜在表現におけるグローバルな類似性を捉えられていないという限界を解消すること。
  • 非局所文脈モデリングにおける参照情報の欠落問題に対処するため、プロキシ類似度関数と空間マスクを導入すること。
  • マスク付き畳み込みネットワークにおける非局所注意ブロックを用いて、局所的およびグローバルな文脈表現を統合することで、エントロピー推定の精度を向上させること。
  • メモリおよび時間効率の良いU-Netブロックを分析および合成変換部に設計し、情報損失を低減し、低歪み圧縮性能を向上させること。
  • 学習されたエントロピーモデリングをレート損失として用いることで、レートと歪みを共同最適化し、画像圧縮分野における最先端の性能を達成すること。

提案手法

  • 潜在表現特徴間のグローバルな類似性を推定するためのプロキシ類似度関数を導入し、直接的な参照がなくても非局所的文脈モデリングが可能になるようにする。
  • 不要な領域を抑制し、非局所計算中の注目度を向上させるために、空間マスクを用いる。
  • マスク付き畳み込みからの局所的文脈(local context)と類似度に基づく特徴からのグローバルな文脈(global context)を統合する非局所注意ブロックを設計し、エントロピーモデリングを強化する。
  • 非局所注意ブロックをマスク付き畳み込みネットワークアーキテクチャに統合し、潜在表現の条件付き確率分布をモデリングする。
  • 分析および合成変換部にU-Netに類似たブロックを提案することで、ネットワーク幅を効率的に拡大し、メモリおよび時間複雑度を低減する。
  • 学習されたエントロピーモデルを、レートと歪みを共同最適化する際のレート損失として用い、完全な画像圧縮フレームワークの学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1潜在表現におけるグローバルな類似性は、局所的文脈モデリングを越えてエントロピー推定を向上させるために効果的に活用可能か?
  • RQ2ディープラーニングベースの画像圧縮における非局所文脈モデリングの参照情報欠落問題は、どのようにしてプロキシ類似度関数と空間マスクを用いて解決できるか?
  • RQ3非局所注意ブロックを介して局所的およびグローバルな文脈表現を統合することで、より優れたエントロピーモデリングおよび圧縮性能が得られるか?
  • RQ4変換部にU-Netに類似たブロックを採用することで、計算コストを管理しつつ、より高いネットワーク幅を実現可能であり、低歪み圧縮性能を向上させられるか?
  • RQ5提案手法は、既存の画像圧縮基準およびディープラーニングモデルと比較して、どの程度レート・ドレステーション性能で優れているか?

主な発見

  • 提案された文脈ベースの非局所エントロピーモデルは、CCNベースのモデルを顕著に上回り、14のコードセット全体で平均して15%のビット数削減を達成した。
  • Kodakデータセットでは、0.25 bppで34.82 dBのPSNRを達成し、以前のSOTA手法および高ビットレートでのJPEG 2000を上回った。
  • U-Netブロックにより、GPUメモリ制限を超えない範囲で、64チャネルの高いネットワーク幅を実現できた。これに対して、残差ブロックではフル画像処理で失敗した。
  • U-Netベースの変換部は、残差ベースのものと比較して2.5倍高速で、GPUメモリ使用量も40%削減しながら、同等のPSNRを維持した。
  • 非局所注意機構は、局所的文脈のみで不十分なトップコードプレーンで顕著な優位性を示した。
  • MS-SSIMを最適化対象としたモデルは、MSE最適化モデルと比較して、構造的保持性が優れており、より優れた知覚的品質を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。