[論文レビュー] N-Gram in Swin Transformers for Efficient Lightweight Image Super-Resolution
本稿では、隣接する局所ウィンドウを横断するスライディングウィンドウ自己注意を用いて有効な受容 field を拡大することで、効率的で軽量な画像超解像のための N-gram コンテキストをスウィン変換器に導入する。チャネル削減型グループ畳み込みを用いてユニ・グラム埋め込みを生成し、スケーリング余弦注意と統合することで、提案された NGswin モデルは、FLOPs を削減しつつ最先端の性能を達成する。さらに、SwinIR-NG は複数のデータセットにおいて、軽量超解像ベンチマークをさらに向上させる。
While some studies have proven that Swin Transformer (Swin) with window self-attention (WSA) is suitable for single image super-resolution (SR), the plain WSA ignores the broad regions when reconstructing high-resolution images due to a limited receptive field. In addition, many deep learning SR methods suffer from intensive computations. To address these problems, we introduce the N-Gram context to the low-level vision with Transformers for the first time. We define N-Gram as neighboring local windows in Swin, which differs from text analysis that views N-Gram as consecutive characters or words. N-Grams interact with each other by sliding-WSA, expanding the regions seen to restore degraded pixels. Using the N-Gram context, we propose NGswin, an efficient SR network with SCDP bottleneck taking multi-scale outputs of the hierarchical encoder. Experimental results show that NGswin achieves competitive performance while maintaining an efficient structure when compared with previous leading methods. Moreover, we also improve other Swin-based SR methods with the N-Gram context, thereby building an enhanced model: SwinIR-NG. Our improved SwinIR-NG outperforms the current best lightweight SR approaches and establishes state-of-the-art results. Codes are available at https://github.com/rami0205/NGramSwin.
研究の動機と目的
- スウィン変換器における標準的なウィンドウ自己注意(WSA)の受容 field の制限が、高解像度画像再構成におけるコンテキストの活用を制限することに起因する問題を解決すること。
- 特にパrameter バジェットが制限される実世界の展開を想定した、深層学習ベースの超解像モデルにおける計算複雑性の低減を図ること。
- 新たな N-gram メカニズムを用いて隣接する局所ウィンドウからの空間的コンテキストを活用することで、軽量超解像の性能を向上させること。
- Swinベースの超解像モデル(SwinIR-light や HNCT など)に既存の N-gram コンテキストを適用することで、一般化可能性を実証すること。
提案手法
- スウィン変換器における N-gram を、隣接する局所ウィンドウ間の相互作用として定義し、隣接ウィンドウからのユニ・グラム埋め込みをスライディング WSA を用いて処理することで、有効な受容 field を拡大する。
- N-gram 相互作用の計算コストを低減するため、チャネル削減型グループ畳み込みを導入して低次元のユニ・グラム埋め込みを生成する。
- 階層的エンコーダ(パッチマージングを含む)、非対称な小さなデコーダ、およびマルチスケール特徴を統合する SCDP ボトルネックを備えた、効率的な SR ネットワークである NGswin を提案する。
- N-gram スウィン変換器ブロック(NSTB)において、スウィン V2 からのスケーリング余弦注意を採用することで、注意の効率性と表現力を向上させる。
- 既存のスウィンベースのモデルに N-gram コンテキストを適用し、SwinIR-NG を構築することで、モデルサイズを著しく増加させずに性能を向上させる。
- エンコーダから得られるマルチスケール特徴を効率的に統合するため、ピクセルシャッフル、連結、ディープワイズ畳み込み、ポイントワイズプロジェクションから成る SCDP ボトルネックを用いる。

実験結果
リサーチクエスチョン
- RQ1スウィン変換器におけるウィンドウ自己注意の受容 field を拡大することで、計算コストを増加させることなく画像超解像性能を向上させることができるか?
- RQ2隣接する局所ウィンドウから得られる新たな N-gram コンテキストは、画像修復のための長距離空間的依存関係をどれほど効果的に捉えられるか?
- RQ3提案された N-gram メカニズムは、既存のスウィン変換器ベースの超解像モデルに一般化可能か?
- RQ4SCDP ボトルネックおよび階層的エンコーダ・デコーダ設計は、軽量超解像におけるモデルの効率性と性能にどのような影響を及えるか?
- RQ5N-gram コンテキストは、多様なベンチマークデータセットにおいて、視覚的品質と定量的指標の両面で顕著な向上をもたらすか?
主な発見
- NGswin は、×2 スケーリングの際、Set5、Set14、BSD100、Urban100、Manga109 で競争力ある性能を達成し、FLOPs はわずか 82.39G にとどまる。これは、以前の最先端手法よりも効率性に優れている。
- SwinIR-NG は、SwinIR-light に N-gram コンテキストを適用した拡張版であり、軽量超解像分野で最先端の結果を達成し、×2 スケーリングで Set5 において 38.10/0.9610 の PSNR を達成した。
- N-gram コンテキストにより、HNCT は Set5 における ×2 スケーリングで 0.02 dB の PSNR 向上(38.10 対 38.08)を達成し、×3 および ×4 スケーリングでも 0.01 dB の向上を示したが、FLOPs の増加はわずかであった。
- SCDP ボトルネックは性能向上に顕著な寄与を示し、デフォルトアーキテクチャに追加することで、Set5 における ×2 スケーリングで PSNR が 0.05 dB 向上(38.05 対 38.08)した。
- 視覚的比較では、NGswin および SwinIR-NG は、テクスチャーやシーンテキストのような複雑な領域において、ベースラインモデルよりも明確なエッジとシャープなテクスチャを再構成している。
- SwinIR-NG は ST-VQA テストセットにおけるシーンテキスト検出性能を向上させ、高解像度入力を必要とする下流のビジョンタスクにおいても利点を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。