Skip to main content
QUICK REVIEW

[論文レビュー] Frequency-Aware Transformer for Learned Image Compression

Han Li, Shaohui Li|arXiv (Cornell University)|Oct 25, 2023
Advanced Data Compression Techniques被引用数 7
ひとこと要約

本稿では、周波数分解ウィンドウ自己注意(FDWA)と周波数変調フィードフォワードネットワーク(FMFFN)を用いて、マルチスケールかつ方向性周波数解析を可能にする学習済み画像圧縮向け周波数に配慮したトランスフォーマー(FAT)ブロックを提案する。この手法は、Kodak、Tecnick、CLICデータセットにおいてVTM-12.1を14.5–15.1%上回るBD-rate性能を達成し、最先端の率歪み性能を実現した。

ABSTRACT

Learned image compression (LIC) has gained traction as an effective solution for image storage and transmission in recent years. However, existing LIC methods are redundant in latent representation due to limitations in capturing anisotropic frequency components and preserving directional details. To overcome these challenges, we propose a novel frequency-aware transformer (FAT) block that for the first time achieves multiscale directional ananlysis for LIC. The FAT block comprises frequency-decomposition window attention (FDWA) modules to capture multiscale and directional frequency components of natural images. Additionally, we introduce frequency-modulation feed-forward network (FMFFN) to adaptively modulate different frequency components, improving rate-distortion performance. Furthermore, we present a transformer-based channel-wise autoregressive (T-CA) model that effectively exploits channel dependencies. Experiments show that our method achieves state-of-the-art rate-distortion performance compared to existing LIC methods, and evidently outperforms latest standardized codec VTM-12.1 by 14.5%, 15.1%, 13.0% in BD-rate on the Kodak, Tecnick, and CLIC datasets.

研究の動機と目的

  • 既存の学習済み画像圧縮手法が非等方的周波数成分を捉えることや方向性の詳細を保持することに限界を示していることに対処すること。
  • 自己注意メカニズムを用いて、潜在表現におけるエンドツーエンドの、学習可能なマルチスケールおよび方向性周波数分解を可能にすること。
  • 周波数変調フィードフォワードネットワークを通じて周波数成分を適応的に変調することで、率歪み性能を向上させること。
  • トランスフォーマーに基づくチャネル別自己回帰的エントロピー・モデルを用いて、周波数成分間のチャネル依存関係をモデル化すること。

提案手法

  • 周波数成分の低周波、高周波、縦方向、横方向成分を1つの自己注意層で捉えるために、4種類の異なる窓形状を持つ周波数分解ウィンドウ自己注意(FDWA)を提案する。
  • 周波数ドメインにおける学習済みフィルタに基づき、周波数成分を適応的に増幅または抑制する周波数変調フィードフォワードネットワーク(FMFFN)を導入する。
  • 因果マスクを用いて周波数成分およびチャネル間の依存関係をモデル化する、トランスフォーマーに基づくチャネル別自己回帰的(T-CA)エントロピー・モデルを設計する。
  • FATブロックに基づく非線形変換と、解析変換および合成変換の共同最適化を用いたエンドツーエンド学習を採用する。
  • FDWAの周波数分解能力を検証するために、特徴マップの周波数コンテンツの可視化および分析に高速フーリエ変換(FFT)を用いる。
  • モデルの複雑さと性能のバランスを図るため、スライス間で共通のトランスフォーマー・アーキテクチャを採用し、最適な率歪みトレードオフを得るためにハイパーパrameterを調整する。

実験結果

リサーチクエスチョン

  • RQ1自己注意メカニズムを用いた学習済み画像圧縮フレームワーク内で、自然画像のマルチスケールかつ方向性周波数成分を効果的に捉えることができるか?
  • RQ2学習可能なフィルタを用いた周波数成分の適応的変調が、率歪み性能をどのように向上させるか?
  • RQ3トランスフォーマーに基づくチャネル別自己回帰的モデルは、周波数サブバンド間のチャネル依存関係を捉えることで、どの程度エントロピー・モデリングを改善できるか?
  • RQ4既存のLICモデルにおける手作業設計または非方向性自己注意と比較して、周波数に配慮した自己注意モジュールのエンドツーエンド最適化が、より高い圧縮効率をもたらすか?

主な発見

  • 提案されたFATモデルは、最先端の率歪み性能を達成し、KodakデータセットにおいてVTM-12.1を14.5%上回るBD-rate性能を示した。
  • Tecnickデータセットでは、VTM-12.1を15.1%上回るBD-rate改善を達成し、多様な画像セットにおいて一貫した優位性を示した。
  • CLIC Professional Validationデータセットでは、VTM-12.1を13.0%上回るBD-rateの向上を達成し、ベンチマーク基準にわたる頑健性を確認した。
  • スペクトル解析により、FDWAが周波数成分を効果的に分離していることが確認された:LL-WAは低周波を捉え、HH-WAは高周波を捉え、HL/LH-WAは方向性成分を捉えた。
  • FMFFNフィルタの可視化により、高ビットレートモデルがより多くの高周波成分を学習していることが示され、適応的変調メカニズムの有効性が裏付けられた。
  • T-CAエントロピー・モデルは、スライス数を半分(5 vs 10)に減らし、モデルの複雑さも低減しながらも、CHARMを上回るR-D性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。