[論文レビュー] Xformer: Hybrid X-Shaped Transformer for Image Denoising
Xformerは、空間的およびチャネル的次元の両方におけるグローバルな依存関係を、独立した空間的およびチャネル的Transformerブロックを用いて同時にモデル化するハイブリッドX字型Transformerを提案する。双方向接続ユニット(BCU)を用いたインタラクティブな特徴抽出により、同等のFLOPsおよびモデルサイズで、合成および実世界のノイズ除去ベンチマークで最先端の性能を達成する。
In this paper, we present a hybrid X-shaped vision Transformer, named Xformer, which performs notably on image denoising tasks. We explore strengthening the global representation of tokens from different scopes. In detail, we adopt two types of Transformer blocks. The spatial-wise Transformer block performs fine-grained local patches interactions across tokens defined by spatial dimension. The channel-wise Transformer block performs direct global context interactions across tokens defined by channel dimension. Based on the concurrent network structure, we design two branches to conduct these two interaction fashions. Within each branch, we employ an encoder-decoder architecture to capture multi-scale features. Besides, we propose the Bidirectional Connection Unit (BCU) to couple the learned representations from these two branches while providing enhanced information fusion. The joint designs make our Xformer powerful to conduct global information modeling in both spatial and channel dimensions. Extensive experiments show that Xformer, under the comparable model complexity, achieves state-of-the-art performance on the synthetic and real-world image denoising tasks. We also provide code and models at https://github.com/gladzhang/Xformer.
研究の動機と目的
- 畳み込みニューラルネットワーク(CNN)および標準的なTransformerが、画像ノイズ除去における長距離依存関係と動的コンテンツをモデル化する点で抱える限界を解消すること。
- 空間的およびチャネル的トークン相互作用を同時にモデル化することで、グローバルな表現学習を向上させること。
- 計算コストを増加させずに多次元グローバル特徴を統合する効率的で並列的なネットワークアーキテクチャを設計すること。
- 単純な連結よりも優れた特徴表現を実現する双方向統合メカニズムを設計すること。
- 最小限の計算オーバーヘッドで、合成および実世界の画像ノイズ除去タスクにおいて最先端の性能を達成すること。
提案手法
- Xformerは、並列な二重ブランチアーキテクチャを採用する:一方のブランチは空間的自己注意を用いて空間次元に沿った局所的なパッチ相互作用をモデル化する。
- もう一方のブランチはチャネル的自己注意を適用し、チャネル次元に沿ったグローバルなコンテキストを捉えることで、長距離依存関係のモデル化を可能にする。
- 各ブランチは、空間的およびチャネル的表現からのマルチスケール特徴を抽出するためにエンコーダ・デコーダ構造を用いる。
- 双方向接続ユニット(BCU)は、3×3畳み込みを介して両ブランチからの特徴を統合し、残差接続を追加することで表現学習を強化する。
- BCUにより、両ブランチ間で情報の双方向的フローが可能となり、相補的な情報を用いて各ブランチの特徴が相互に精錬される。
- 標準的なL1損失および知覚的損失の目的関数を用いて、合成および実世界のノイズ除去データセット上でエンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1空間的およびチャネル的自己注意の並列的モデリングは、画像ノイズ除去におけるグローバル表現を向上させ得るか?
- RQ2空間的およびチャネル的ブランチ間の双方向特徴統合は、単方向的または連結型統合と比較して、ノイズ除去性能をどのように向上させるか?
- RQ3ハイブリッドX字型Transformerは、既存の最先端手法と同等のFLOPsおよびモデルサイズで最先端の結果を達成できるか?
- RQ4ノイズが非i.i.d.かつ複雑な実世界のノイズ画像に対して、本手法はどのように性能を発揮するか?
- RQ5局所的なパッチレベルの注意とグローバルなチャネルレベルの注意を統合することで、繊細なテクスチャおよび高周波数成分の保存が向上するか?
主な発見
- Xformerは、σ=50のUrban100ベンチマークで32.18 dBのPSNRを達成し、同等のモデル複雑度下でRestormerを0.34 dB上回る。
- SIDD実世界ベンチマークでは、UformerやRestormerを含むすべての比較手法の中で最高のPSNRおよびSSIMスコアを達成する。
- Xformerは、Uformerと比較してFLOPsを2.01倍削減しながらも、より高い性能を達成しており、優れた効率性を示している。
- 視覚的結果から、XformerはSwinIR、Restormer、その他の先端手法と比較して、繊細なテクスチャおよび高周波成分をよりよく保持している。
- 双方向接続ユニット(BCU)は、特徴統合を著しく向上させ、アブレーションスタディにより表現学習の向上に有効であることが確認されている。
- Xformerは実世界のノイズに優れた一般化性能を示しており、DNDベンチマークで優れた結果を達成し、挑戦的なSIDD例においても視覚的に魅力的な出力を得ている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。