Skip to main content
QUICK REVIEW

[論文レビュー] Stripformer: Strip Transformer for Fast Image Deblurring

Fu-Jen Tsai, Yan‐Tsung Peng|arXiv (Cornell University)|Apr 10, 2022
Advanced Image Processing Techniques被引用数 10
ひとこと要約

Stripformer は、異なる方向と大きさの領域特有のぼやけを捉えるために、インタリースト内およびインタリースト間の自己注意メカニズムを用いた、トークンおよびパラメータに効率的なトランスフォーマー・アーキテクチャを提案する。このアーキテクチャは、従来のトランスフォーマーと比較して顕著に少ない FLOPs と推論時間で、GoPro、HIDE、RealBlur データセットにおいて最先端の性能を達成する。

ABSTRACT

Images taken in dynamic scenes may contain unwanted motion blur, which significantly degrades visual quality. Such blur causes short- and long-range region-specific smoothing artifacts that are often directional and non-uniform, which is difficult to be removed. Inspired by the current success of transformers on computer vision and image processing tasks, we develop, Stripformer, a transformer-based architecture that constructs intra- and inter-strip tokens to reweight image features in the horizontal and vertical directions to catch blurred patterns with different orientations. It stacks interlaced intra-strip and inter-strip attention layers to reveal blur magnitudes. In addition to detecting region-specific blurred patterns of various orientations and magnitudes, Stripformer is also a token-efficient and parameter-efficient transformer model, demanding much less memory usage and computation cost than the vanilla transformer but works better without relying on tremendous training data. Experimental results show that Stripformer performs favorably against state-of-the-art models in dynamic scene deblurring.

研究の動機と目的

  • 動的シーンにおける非一様で領域特有の運動ぼやけの課題に対処すること。これは、従来の事前知識や標準的な CNN では難しい。
  • 画像のぼやけ取りにおいて、従来のトランスフォーマーの高いメモリと計算コストを克服しつつ、グローバルおよびローカルな特徴モデリング能力を維持すること。
  • 構造化されたトークン化と注意メカニズムを通じて、ぼやけの方向と大きさを効率的に捉えるハイブリッド・トランスフォーマー・アーキテクチャを設計すること。
  • ImageNet などの大規模事前学習データセットに依存せずに、最先端のぼやけ取り性能を達成すること。
  • 推論時間、パラメータ数、FLOPs の面でモデルの効率性を確保しながら、ベンチマークデータセットで高い PSNR を維持すること。

提案手法

  • 画像の水平および垂直ストリップ内のピクセル間の依存関係をモデル化するインラインストリップ自己注意(Intra-SA)を導入し、局所的なぼやけ特徴を捉える。
  • ストリップ間の相関をモデル化するインターストリップ自己注意(Inter-SA)を実装し、水平および垂直方向の両方でグローバルな領域特有のぼやけパターンを符号化する。
  • スケールに応じてぼやけの大きさと方向を段階的に明らかにするために、インタリースト型のインラインストリップおよびインターストリップ自己注意ブロックをスタックする。
  • 任意の入力サイズをサポートし、固定位置エンコーディングよりも性能を向上させるために、条件付き位置エンコーディング(CPE)を用いる。
  • 特徴の識別性を高め、ぼやけ取り品質を向上させるために、訓練中にコントラスト損失を統合する。
  • 完全な特徴マップ自己注意を回避することで、パラメータおよびメモリ効率を高め、1280×720 画像に対して FLOPs を約 6.9G に削減するアーキテクチャを設計する。

実験結果

リサーチクエスチョン

  • RQ1構造化されたストリップベースのトークンを用いたハイブリッド・トランスフォーマー・アーキテクチャは、計算コストを低減しつつ、標準的なトランスフォーマーを上回るぼやけ取り性能を達成できるか?
  • RQ2インラインストリップおよびインターストリップ自己注意メカニズムは、非一様な運動ぼやけの方向性と大きさの変動をどの程度効果的に捉えることができるか?
  • RQ3提案された注意メカニズム設計は、大規模事前学習データなしでどの程度ぼやけ取り性能を向上させるか?
  • RQ4インラインストリップおよびインターストリップ自己注意の組み合わせは、Swin や CCNet などの他の効率的な注意メカニズムと比較して、ぼやけ取りタスクでどの程度優れているか?
  • RQ5条件付き位置エンコーディングとコントラスト損失の併用は、実世界のぼやけデータセットにおけるぼやけ取り性能をさらに向上させるか?

主な発見

  • GoPro データセットにおいて、Stripformer は 33.08 の PSNR を達成し、DeblurGAN-v2、SRN、MPRNet、MIMO など、以前の最先端手法を上回った。
  • HIDE データセットでは、2000万パラメータしか使用しないにもかかわらず、Swin や Twins を含むすべての比較手法を上回る 31.03 の PSNR を達成した。
  • 1280×720 画像において、FLOPs を 6.9G、推論時間を 48ms にまで低減した。これは IPT よりも顕著に低い(32G FLOPs)が、優れた性能を維持している。
  • アブレーションスタディの結果、インラインストリップおよびインターストリップ自己注意の組み合わせが最良の性能を示し、CPE やコントラスト損失がさらに結果を向上させた。
  • GoPro および HIDE データセットにおいて、Swin や CCNet、Twins よりも高い PSNR を達成した。これは、ぼやけの方向と大きさをモデリングする上で、本手法の有効性を示している。
  • ImageNet 事前学習に依存せず、最先端の結果を達成した。これは、ぼやけ取りタスクにおいて、データ効率性と強いインダクティブバイアスを有していることを証明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。