Skip to main content
QUICK REVIEW

[論文レビュー] DLGSANet: Lightweight Dynamic Local and Global Self-Attention Networks for Image Super-Resolution

Xiang Li, Jinshan Pan|arXiv (Cornell University)|Jan 5, 2023
Advanced Image Processing Techniques被引用数 6
ひとこと要約

DLGSANetは、局所的特徴抽出にマルチヘッド動的局所自己注意(MHDLSA)を、選択的グローバル特徴集約にスパースグローバル自己注意(SparseGSA)を組み合わせたハイブリッドダイナミックトランスフォーマーブロック(HDTB)を用いた軽量で効率的な画像超解像ネットワークを提案する。本手法は500万パラメータ未満で実現され、先行モデルと比較して顕著に少ないFLOPsで最先端の性能を達成する。

ABSTRACT

We propose an effective lightweight dynamic local and global self-attention network (DLGSANet) to solve image super-resolution. Our method explores the properties of Transformers while having low computational costs. Motivated by the network designs of Transformers, we develop a simple yet effective multi-head dynamic local self-attention (MHDLSA) module to extract local features efficiently. In addition, we note that existing Transformers usually explore all similarities of the tokens between the queries and keys for the feature aggregation. However, not all the tokens from the queries are relevant to those in keys, using all the similarities does not effectively facilitate the high-resolution image reconstruction. To overcome this problem, we develop a sparse global self-attention (SparseGSA) module to select the most useful similarity values so that the most useful global features can be better utilized for the high-resolution image reconstruction. We develop a hybrid dynamic-Transformer block(HDTB) that integrates the MHDLSA and SparseGSA for both local and global feature exploration. To ease the network training, we formulate the HDTBs into a residual hybrid dynamic-Transformer group (RHDTG). By embedding the RHDTGs into an end-to-end trainable network, we show that our proposed method has fewer network parameters and lower computational costs while achieving competitive performance against state-of-the-art ones in terms of accuracy. More information is available at https://neonleexiang.github.io/DLGSANet/

研究の動機と目的

  • 従来のトランスフォーマーに基づく超解像モデルが抱える高い計算コストとパラメータ負荷を軽減すること。
  • 固定ウィンドウパーティショニングに依存しない動的で畳み込みに類似た局所自己注意を導入することで、局所特徴抽出の性能を向上させること。
  • スパース機構を用いて不必要な注意値をプルーニングすることで、関連性の高い注意値のみを保持し、不要なトークンからのノイズを回避することで、グローバル特徴集約を強化すること。
  • 最小限のパラメータとFLOPsで高品質な再構成性能を維持する、軽量でエンドツーエンドで訓練可能なネットワークを開発すること。

提案手法

  • 固定ウィンドウ制約なしに効率的な局所特徴学習を可能にする、完全畳み込みアーキテクチャを用いたマルチヘッド動的局所自己注意(MHDLSA)モジュールを導入。
  • 類似度計算後にReLUを適用して、類似度が低い値をプルーニングし、最も有用なグローバル特徴のみを保持するスパースグローバル自己注意(SparseGSA)モジュールを提案。
  • MHDLSAとSparseGSAを統合して、パラメータ効率的に局所的およびグローバルな依存関係を同時に捉えるハイブリッドダイナミックトランスフォーマーブロック(HDTB)を設計。
  • 残差学習により訓練の安定化と特徴表現の向上を図るため、残差ハイブリッドダイナミックトランスフォーマーグループ(RHDTG)を構築。
  • スタックされたRHDTGから構成されるエンドツーエンドで訓練可能なネットワークとして、全DLGSANetをアーキテクチャ設計し、高解像度画像再構成を実現。
  • 最小限のパラメータ数と低FLOPsを実現する軽量設計を採用し、標準ベンチマークで競争力のある性能を達成。

実験結果

リサーチクエスチョン

  • RQ1固定ウィンドウパーティショニングに依存しない動的局所自己注意メカニズムは、超解像ネットワークにおける局所特徴抽出を向上させることができるか?
  • RQ2スパース機構による不必要なグローバル注意値のプルーニングは、より良い特徴表現と再構成品質をもたらすか?
  • RQ3動的局所とスパースグローバル自己注意を統合したハイブリッドアテンションブロックは、顕著に低いモデル複雑度で最先端の性能を達成できるか?
  • RQ4従来のCNNおよびトランスフォーマーに基づくSISRモデルと比較して、本手法の精度、パラメータ数、推論速度はどのように異なるか?

主な発見

  • Urban100データセットにおける4倍拡大時、DLGSANetはPSNR 27.17を達成し、MHSAベースラインを0.28dB上回る。
  • スパースグローバル自己注意(SparseGSA)モジュールは、標準のソフトマックスベースのグローバル自己注意と比較してPSNRを0.12dB向上。
  • RTX 3090 GPU上での4倍拡大時、モデルはたった476万パラメータ、推論時間187msで実行され、SwinIR(278ms)やELAN(243ms)と比較して顕著に低い。
  • 軽量版であるDLGSANet-tinyは4倍拡大時38msの推論時間で実行され、精度ではEDSR-baseline(15ms)を上回り、多数のトランスフォーマー基盤モデルよりも効率的である。
  • アブレーションスタディの結果、MHDLSAとSparseGSAの両方が性能向上に顕著な寄与をしていることが確認され、それぞれベースラインからPSNRを0.28dBおよび0.12dB向上。
  • 可視化結果から、SparseGSAが不要な注意値を効果的に抑制し、構造的で詳細を保持する特徴に注目することで、より優れた再構成性能を実現していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。