Skip to main content
QUICK REVIEW

[論文レビュー] Enlarging Context with Low Cost: Efficient Arithmetic Coding with Trimmed Convolution

Mu Li, Shuhang Gu|arXiv (Cornell University)|Jan 15, 2018
Video Coding and Compression Technologies被引用数 4
ひとこと要約

本稿では、共有計算を用いて大規模な文脈をモデル化するトランクド畳み込みを用いた、画像圧縮における算術符号化の高効率な手法であるTrimmed Convolutional Arithmetic Encoding (TCAE)を提案する。この手法により、リアルタイムの符号化が可能となる。さらに、並列復号化を可能にするスロープTCAEを導入し、顕著な圧縮損失なしに60倍以上の高速化を達成した。

ABSTRACT

Arithmetic coding is an essential class of coding techniques. One key issue of arithmetic encoding method is to predict the probability of the current coding symbol from its context, i.e., the preceding encoded symbols, which usually can be executed by building a look-up table (LUT). However, the complexity of LUT increases exponentially with the length of context. Thus, such solutions are limited to modeling large context, which inevitably restricts the compression performance. Several recent deep neural network-based solutions have been developed to account for large context, but are still costly in computation. The inefficiency of the existing methods are mainly attributed to that probability prediction is performed independently for the neighboring symbols, which actually can be efficiently conducted by shared computation. To this end, we propose a trimmed convolutional network for arithmetic encoding (TCAE) to model large context while maintaining computational efficiency. As for trimmed convolution, the convolutional kernels are specially trimmed to respect the compression order and context dependency of the input symbols. Benefited from trimmed convolution, the probability prediction of all symbols can be efficiently performed in one single forward pass via a fully convolutional network. Furthermore, to speed up the decoding process, a slope TCAE model is presented to divide the codes from a 3D code map into several blocks and remove the dependency between the codes inner one block for parallel decoding, which can 60x speed up the decoding process. Experiments show that our TCAE and slope TCAE attain better compression ratio in lossless gray image compression, and can be adopted in CNN-based lossy image compression to achieve state-of-the-art rate-distortion performance with real-time encoding speed.

研究の動機と目的

  • 大規模な文脈をモデル化する際の従来のルックアップテーブル(LUT)ベースの算術符号化における計算非効率性を解消すること。
  • 深層学習ベースのエントロピー符号化における逐次的確率予測の制限を克服し、リアルタイム性能を実現すること。
  • 符号化順序と文脈依存性を尊重しつつ、1回のフォワードパスで全シンボルの完全な畳み込み的確率予測を効率的に行えるようにすること。
  • 3次元コードマップを独立したブロックに再構成することで、並列処理を可能にし、復号化を高速化すること。
  • 提案手法をCNNベースの損失あり画像圧縮パイプラインに統合し、リアルタイムの符号化速度を維持しながらレート・ディストーション性能を向上させること。

提案手法

  • 符号化されていないシンボルを文脈から除外するためのバイナリマスクを適用するトリムド畳み込み演算を導入し、符号化順序制約を保持する。
  • 隣接するシンボル間で共有計算を活用することで、1回のフォワードパスで全シンボルの連合確率予測を実行する完全畳み込みネットワークアーキテクチャを設計する。
  • 入力層に加えて、すでに符号化済みの文脈情報が含まれる隠れ特徴マップに対してもトリムド畳み込みを適用する。
  • 3次元コードマップを、座標の和(i+j+k=t)に基づいてブロックに分割するスロープTCAEスケジュールを提案する。
  • ブロック間の依存関係を排除することで、復号化を並列化し、正しい復号順序を維持しつつ、同時にコードブロックを処理可能にする。
  • 各点(i,j,k)が1つのバイナリコードに対応する3次元コードマップ表現を用い、コードブロックをi+j+kの値が等しい点の集合として定義する。

実験結果

リサーチクエスチョン

  • RQ1完全畳み込みネットワークにトリムド畳み込みを適用することで、計算効率を維持しつつ大規模な文脈を効率的にモデル化できるか?
  • RQ2各シンボルごとの独立的予測と比較して、トリムド畳み込みの使用が確率予測の効率をどの程度向上させるか?
  • RQ3ブロック分割による並列復号化が、圧縮レートを損なわずに復号プロセスをどの程度高速化できるか?
  • RQ4提案されたTCAEおよびスロープTCAE手法が、CNNベースの損失あり画像圧縮システムに効果的に統合可能か?
  • RQ5標準TCAEおよび従来のエントロピー符号化手法と比較して、スロープTCAEを用いる際の圧縮効率と復号速度のトレードオフはどの程度か?

主な発見

  • TCAEはLiら[4]の畳み込みエントロピー符号化器と比較して、符号化時間で7–20倍の高速化を達成し、752×496×3の画像では最小0.166秒の符号化時間が実現された。
  • スロープTCAEは94×68×64のコードマップに対して0.62秒の復号時間を達成し、TCAEと比較して60倍以上、ベースライン符号化器と比較して25倍以上の高速化を実現した。
  • 損失なしグレースケール画像圧縮において、TCAEおよびスロープTCAEはPNGおよびJPEG2000-LSを上回る圧縮レートを達成し、特に高いビットレートで顕著な優位性を示した。
  • CNNベースの損失あり圧縮(例:[4])に統合した場合、TCAEは全テストビットレート(bpp ≥ 0.4)でレート・ディストーション性能を向上させ、競合手法を上回った。
  • スロープTCAEモデルは、実験では無視できる範囲の圧縮レートの低下しか引き起こさず、コードブロック内での独立性仮定の妥当性を裏付けた。
  • 標準的な画像サイズにおいて、近似的にリアルタイムの符号化(例:25 fps)を達成し、リアルタイムシステムへの実用的導入に適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。