Skip to main content
QUICK REVIEW

[論文レビュー] CSformer: Bridging Convolution and Transformer for Compressive Sensing

Dongjie Ye, Zhangkai Ni|arXiv (Cornell University)|Dec 31, 2021
Sparse and Compressive Sensing Techniques被引用数 10
ひとこと要約

CSformerは、畳み込みニューラルネットワーク(CNNs)とビジョントランスフォーマーを統合したハイブリッドディープラーニングフレームワークを提案する。二重スタムアーキテクチャを採用し、同時にCNNとトランスフォーマーのブランチを処理するとともに、プログレッシブな特徴融合とウィンドウベースのアテンションを組み合わせることで、計算効率を維持しながら、複数のデータセットおよびサンプリング比において、最先端の画像再構成品質を達成した。

ABSTRACT

Convolution neural networks (CNNs) have succeeded in compressive image sensing. However, due to the inductive bias of locality and weight sharing, the convolution operations demonstrate the intrinsic limitations in modeling the long-range dependency. Transformer, designed initially as a sequence-to-sequence model, excels at capturing global contexts due to the self-attention-based architectures even though it may be equipped with limited localization abilities. This paper proposes CSformer, a hybrid framework that integrates the advantages of leveraging both detailed spatial information from CNN and the global context provided by transformer for enhanced representation learning. The proposed approach is an end-to-end compressive image sensing method, composed of adaptive sampling and recovery. In the sampling module, images are measured block-by-block by the learned sampling matrix. In the reconstruction stage, the measurement is projected into dual stems. One is the CNN stem for modeling the neighborhood relationships by convolution, and the other is the transformer stem for adopting global self-attention mechanism. The dual branches structure is concurrent, and the local features and global representations are fused under different resolutions to maximize the complementary of features. Furthermore, we explore a progressive strategy and window-based transformer block to reduce the parameter and computational complexity. The experimental results demonstrate the effectiveness of the dedicated transformer-based architecture for compressive sensing, which achieves superior performance compared to state-of-the-art methods on different datasets.

研究の動機と目的

  • 圧縮センシングにおけるCNNの長距離依存関係のモデル化の限界と、トランスフォーマーの局所的空間的詳細の捉えにくさを克服すること。
  • アダプティブサンプリングと画像再構成を同時に最適化するエンドツーエンドでトレーニング可能なフレームワークを設計すること。
  • CNN(局所的なインダクティブバイアス)とトランスフォーマー(グローバルコンテキストモデリング)の相補的な強みを活かして、より優れた表現学習を実現すること。
  • ウィンドウベースのアテンションメカニズムと段階的な特徴解像度の向上により、トランスフォーマーに基づくCS手法の計算複雑性を低減すること。
  • ハイブリッドCNN-トランスフォーマーアーキテクチャを用いて、ディープラーニングベースの圧縮センシングにおける新しいSOTAベースラインを確立すること。

提案手法

  • フレームワークは二重スタムネットワークを採用:一方のスタムは畳み込み層を用いて局所的近傍関係をモデル化し、もう一方はビジョントランスフォーマーを用いてグローバルな長距離依存関係を捉える。
  • 両スタムからの特徴は複数の解像度で統合され、相補的な表現学習を最大化する。
  • 段階的な特徴精錬戦略により、解像度を徐々に向上させ、メモリと計算コストを削減する。
  • ウィンドウベースのトランスフォーマーブロックは自己アテンション計算を局所的ウィンドウに制限し、FLOPsとモデルサイズを顕著に削減する。
  • サンプリングモジュールは、測定取得を最適化するブロックワイドのアダプティブサンプリング行列を学習する。
  • エンドツーエンドのトレーニングにより、サンプリングと再構成ステージを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドCNN-トランスフォーマーアーキテクチャは、純粋なCNNまたはトランスフォーマーに基づくモデルに比べて、圧縮センシング画像再構成で優れているか?
  • RQ2CNNの局所的インダクティブバイアスとトランスフォーマーのグローバルコンテキストモデリングを、単一のフレームワーク内で効果的に統合できるか?
  • RQ3段階的特徴統合とウィンドウベースのアテンションは、計算効率と再構成品質にどのような影響を与えるか?
  • RQ4二重スタム設計は、単一パスのトランスフォーマーやCNNオンリーモデルに比べて、性能と一般化能力において優れているか?
  • RQ5提案されたアダプティブサンプリング戦略は、さまざまなサンプリング比において再構成忠実度をどの程度向上させるか?

主な発見

  • CSformerは、すべてのデータセットおよびサンプリング比において最高のPSNRを達成し、Direct Average指標における50%サンプリング比でAMP-Netより1.32 dB、OPINE-Netより1.39 dBの向上を示した。
  • Set5データセットにおける50%CS比の条件下で、CSformerは43.55 dBのPSNRを達成し、AMP-Net(42.54 dB)とOPINE-Net(42.12 dB)を上回った。
  • 推論時間は5.0765秒(256×256画像)と高いが、モデルサイズは6.71Mパラメータに保たれ、二パスCNNを備えたDPA-Net(9.78M)に比べ30%小さい。
  • 中心化カーネル整合性分析により、初期のトランスフォーマー特徴は深層CNN特徴に類似していることが示され、トランスフォーマーが早期に長距離依存関係を捉えていることが裏付けられた。一方、CNNはこのようなモデリングを深層のスタックに依存している。
  • 中層および深層での特徴統合は中程度から弱い類似性を示しており、二重スタム設計が局所的およびグローバル表現を効果的にバランスさせていることを確認した。
  • より大きなCOCOデータセットで再トレーニングした結果、CSformerは再トレーニングされたAMP-NetおよびOPINE-Netと比較して、すべての評価指標で最良の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。