Skip to main content
QUICK REVIEW

[論文レビュー] ELIC: Efficient Learned Image Compression with Unevenly Grouped Space-Channel Contextual Adaptive Coding

Dailan He, Ziming Yang|arXiv (Cornell University)|Mar 21, 2022
Advanced Data Compression Techniques被引用数 10
ひとこと要約

ELICは、学習された特徴における情報の凝縮とGDNレイヤーの残差ボトルネックブロックへの置き換えを活用することで、高速な復号速度を維持したまま、最先端のレート・ディストーション性能を達成する、画期的な学習済み画像圧縮フレームワークを提案する。不均一にグループ化されたチャネル条件付きエントロピー符号化と空間的文脈モデリングを組み合わせることで、圧縮性能を向上させつつ、高速なプレビューと段階的復号を可能にし、実世界への導入を促進する。

ABSTRACT

Recently, learned image compression techniques have achieved remarkable performance, even surpassing the best manually designed lossy image coders. They are promising to be large-scale adopted. For the sake of practicality, a thorough investigation of the architecture design of learned image compression, regarding both compression performance and running speed, is essential. In this paper, we first propose uneven channel-conditional adaptive coding, motivated by the observation of energy compaction in learned image compression. Combining the proposed uneven grouping model with existing context models, we obtain a spatial-channel contextual adaptive model to improve the coding performance without damage to running speed. Then we study the structure of the main transform and propose an efficient model, ELIC, to achieve state-of-the-art speed and compression ability. With superior performance, the proposed model also supports extremely fast preview decoding and progressive decoding, which makes the coming application of learning-based image compression more promising.

研究の動機と目的

  • 学習された画像圧縮における圧縮効率と復号速度のトレードオフを解消すること。
  • 学習済み特徴における情報の凝縮を活用して、エントロピー符号化の効率を向上させること。
  • GDNレイヤーの代わりに残差ボトルネックブロックを用いた高速でスケーラブルな非線形変換を設計すること。
  • 高速なプレビューと段階的復号機能を提供することで、実用的導入を可能にすること。
  • 産業的採用に適した、レート・ディストーション性能と推論速度のバランスをとること。

提案手法

  • 潜在特徴における観測されたエネルギー凝縮に基づき、不均一なチャネル条件付き適応符号化を提案し、エントロピー符号化の冗長性を低減する。
  • 空間的およびチャネル別文脈モデリングを統合したSpace-Channel ConTeXt (SCCTX) モデルを導入し、統合的なエントロピー推定を実現する。
  • 主変換部においてGDN/IGDNレイヤーをスタックされた残差ボトルネック(RB)ブロックに置き換えることで、性能向上と学習安定性の向上を図る。
  • サブミリ秒未満のプレビュー復号を可能にする軽量なサムネイル合成器を採用し、高速な画像プリロードを実現する。
  • グループ化されたチャネルチャンクから順次画像を再構築することで、未符号化シンボルの高コストな予測を回避し、段階的復号を実装する。
  • 不均一なグループ化による高速化、空間的文脈によるRD性能向上、残差ブロックによるスケーラブルな性能向上を統合したハイブリッドアプローチを採用する。

実験結果

リサーチクエスチョン

  • RQ1チャネル条件付きエントロピー符号化におけるチャネルの不均一なグループ化は、圧縮効率を損なわず、遅延を低減できるか?
  • RQ2空間的およびチャネル別文脈モデリングをどのように統合することで、レート・ディストーション性能を向上させられるか?
  • RQ3残差ボトルネックブロックがGDNレイヤーに置き換えられることで、圧縮性能が向上し、かつ速度を維持できるか?
  • RQ4高速なサムネイル合成器を学習させることで、学習済み画像圧縮におけるサブミリ秒未満のプレビューデコードが可能になるか?
  • RQ5計算コストを最小限に抑えて、学習済み圧縮モデルに効率的な段階的復号を実装できるか?

主な発見

  • ELICはKodakおよびCLIC Professionalデータセットにおいて最先端の性能を達成し、PSNRおよびMS-SSIMの両面でVVCを上回った。
  • 提案された不均一なグループ化により、均一な10グループ化方式と比較して、適応的エントロピー推定の遅延が50%削減された。
  • GDNレイヤーを残差ボトルネックブロックに置き換えることで、Ballé2018ではBDレートが最大13.56%改善され、Minnen2018では11.14%改善され、推論速度は同等を維持した。
  • サムネイル合成器は約3マイクロ秒でプレビューサムネイルを生成でき、全復号より12倍以上高速であった。
  • 最初の16チャンネルからの段階的復号でも構造的詳細が再構築可能で、5グループで完全な品質が達成された。
  • SCCTXモデルは、10スライスの均一なグループ化よりも高速な復号を実現しながら、より優れたレート・ディストーション性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。