Skip to main content
QUICK REVIEW

[論文レビュー] SnowFormer: Context Interaction Transformer with Scale-awareness for Single Image Desnowing

Sixiang Chen, Ye Tian|arXiv (Cornell University)|Aug 20, 2022
Image Enhancement Techniques被引用数 7
ひとこと要約

SnowFormer は、マルチヘッドクロスアテンションを用いたスケールに敏感なクエリと局所的・グローバルなコンテキスト相互作用を活用することで、多様な雪による劣化を効果的にモデル化する、新しいトランスフォーマーに基づく単一画像除雪アーキテクチャである。6つの合成および実世界のデータセットにおいて最先端の性能を達成し、競争的な計算効率を示している。

ABSTRACT

Due to various and complicated snow degradations, single image desnowing is a challenging image restoration task. As prior arts can not handle it ideally, we propose a novel transformer, SnowFormer, which explores efficient cross-attentions to build local-global context interaction across patches and surpasses existing works that employ local operators or vanilla transformers. Compared to prior desnowing methods and universal image restoration methods, SnowFormer has several benefits. Firstly, unlike the multi-head self-attention in recent image restoration Vision Transformers, SnowFormer incorporates the multi-head cross-attention mechanism to perform local-global context interaction between scale-aware snow queries and local-patch embeddings. Second, the snow queries in SnowFormer are generated by the query generator from aggregated scale-aware features, which are rich in potential clean cues, leading to superior restoration results. Third, SnowFormer outshines advanced state-of-the-art desnowing networks and the prevalent universal image restoration transformers on six synthetic and real-world datasets. The code is released in \url{https://github.com/Ephemeral182/SnowFormer}.

研究の動機と目的

  • 既存の手法が効果的にモデル化できない、複雑で不規則的かつマルチスケールな雪による劣化を抱える実世界の画像における課題に対処する。
  • CNNベースおよび通常のビジョントランスフォーマー手法の限界を克服し、局所的劣化パターンとグローバルなクリーンな手がかりの両方を捉える。
  • スケールに敏感でパラメータを必要としないクエリを用いることで、効率的な局所的・グローバルなコンテキスト相互作用を可能にし、復元品質を向上させる。
  • 位置符号化を施した劣化に敏感なアテンションリファインヘッドを用いて、テイル特徴における残存雪劣化を段階的に低減する。
  • 従来のユニバーサル画像復元トランスフォーマーと比較して、性能、モデルの複雑さ、推論速度の間で優れたトレードオフを達成する。

提案手法

  • 局所的劣化類似性をモデル化するためのパッチ単位の自己アテンションを用いたローカルインタラクション(LI)を導入し、局所的劣化の認識を強化する。
  • 複数スケールの特徴を統合して得た特徴からクエリジェネレータを介してスケールに敏感なクエリを生成し、追加パラメータなしにグローバルコンテキスト認識を実現する。
  • スケールに敏感なクエリとローカルパッチ埋め込みの間でマルチヘッドクロスアテンションを用いて、効率的な局所的・グローバルコンテキスト相互作用を実現する。
  • マックスプーリングと要素ごとの加算を組み合わせたスケールに敏感な特徴集約により、多様な空間的雪情報の保持を図る。
  • 劣化に敏感な位置符号化を備えたアテンションリファインヘッドを導入し、テイル特徴における残存雪劣化を段階的に改善する。
  • パラメータを必要としないクエリメカニズムを設計することで、通常の自己アテンションの高い計算コストを回避しつつ、グローバルコンテキスト統合を維持する。

実験結果

リサーチクエスチョン

  • RQ1クロスアテンションによる局所的・グローバルコンテキスト相互作用は、CNN や標準的なビジョントランスフォーマーの限界を超えて、単一画像除雪の性能を向上させることができるか?
  • RQ2複数スケール特徴から得たスケールに敏感なクエリ生成は、学習可能なクエリや同じレイヤーのクエリと比較して、復元性能をどのように向上させるか?
  • RQ3ローカルインタラクションによるパッチ内劣化類似性のモデリングは、局所的劣化の認識をどの程度向上させるか?
  • RQ4提案されたアテンションリファインヘッドは、複雑な領域における残存雪劣化を効果的に低減できるか?
  • RQ5既存のユニバーサル画像復元トランスフォーマーと比較して、計算コストとパラメータ数を低く抑えながらも、最先端の性能を達成できるか?

主な発見

  • SnowFormer は CSD データセットで最高の PSNR 39.45 dB と SSIM 0.983 を達成し、すべての先行 SOTA 手法を上回った。
  • アブレーションスタディの結果、パッチ内アテンションを備えたローカルインタラクション(LI)は、LI を含まないベースラインと比較して PSNR で 2.53 dB の向上を示した。
  • スケールに敏感なクエリを用いた局所的・グローバルコンテキスト相互作用(LGCI)は 39.45 dB の PSNR を達成し、学習可能なクエリ(38.03 dB)や同じレイヤーのクエリ(38.36 dB)を大きく上回った。
  • マックスプーリングと加算を組み合わせたスケールに敏感な特徴集約は、最良のトレードオフを実現し、連結(concatenation)と比較して 1.3 dB、マックスプーリング単体と比較して 0.44 dB の PSNR 向上を達成した。
  • SnowFormer はわずか 8.38M のパラメータと 19.44 GFLOPs の計算コストで、顕著に高い FLOPs とパラメータ数を有する手法を上回る競争力ある効率性を維持した。
  • 6つの多様なデータセット(実世界のシーンを含む)において、SnowFormer は一貫して SOTA の結果を達成し、合成および実際の雪劣化の両方に対して高い頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。