[論文レビュー] Hybrid Local-Global Transformer for Image Dehazing.
本稿では、局所的およびグローバルなアテンションパスを畳み込みによる特徴融合で組み合わせることで、計算コストを低減し、特徴表現を向上させるハイブリッド・ローカル・グローバルなビジョン・トランスフォーマー、HyLoG-ViTを提案する。このアーキテクチャは、反射率、シャドー、およびはぎれのない画像予測のための3つのデコーダーを共有エンコーダと統合し、補完的特徴選択モジュールによって強化され、均一、非均一、および夜間の除霧ベンチマークで最先端の性能を達成している。
Recently, the Vision Transformer (ViT) has shown impressive performance on high-level and low-level vision tasks. In this paper, we propose a new ViT architecture, named Hybrid Local-Global Vision Transformer (HyLoG-ViT), for single image dehazing. The HyLoG-ViT block consists of two paths, the local ViT path and the global ViT path, which are used to capture local and global dependencies. The hybrid features are fused via convolution layers. As a result, the HyLoG-ViT reduces the computational complexity and introduces locality in the networks. Then, the HyLoG-ViT blocks are incorporated within our dehazing networks, which jointly learn the intrinsic image decomposition and image dehazing. Specifically, the network consists of one shared encoder and three decoders for reflectance prediction, shading prediction, and haze-free image generation. The tasks of reflectance and shading prediction can produce meaningful intermediate features that can serve as complementary features for haze-free image generation. To effectively aggregate the complementary features, we propose a complementary features selection module (CFSM) to select the useful ones for image dehazing. Extensive experiments on homogeneous, non-homogeneous, and nighttime dehazing tasks reveal that our proposed Transformer-based dehazing network can achieve comparable or even better performance than CNNs-based dehazing models.
研究の動機と目的
- 画像除霧のための標準的ビジョン・トランスフォーマーが、局所的およびグローバルな画像依存関係を効率的に捉えることの限界を解消する。
- 自己アテンション機構の計算複雑性を低減しつつ、低レベルビジョンタスクのための代表的特徴学習を維持する。
- 内在的画像分解(反射率とシャドー)とはぎれのない画像生成を共同で学習することで、除霧性能を向上させる。
- 複数の予測ヘッドから得られる補完的特徴を効果的に選択・集約するメカニズムを開発し、除霧性能を向上させる。
- 非均一および夜間の曇りの強い画像を含む、多様な除霧シナリオにおいて、CNNベースのモデルと同等または優れた性能を達成する。
提案手法
- 局所的ViTパスによる局所的特徴抽出と、長距離依存関係モデリングのためのグローバルViTパスに分割するHyLoG-ViTブロックを提案する。
- 畳み込み層を用いて局所的およびグローバルパスからの特徴を統合し、局所的なインダクティブバイアスとグローバルな文脈認識を組み合わせる。
- 共有エンコーダと3つのデコーダー(反射率予測用、シャドー予測用、はぎれのない画像生成用)を備えた除霧ネットワークを設計する。
- 反射率およびシャドーのヘッドからの最も有用な特徴を動的に選択・集約するための補完的特徴選択モジュール(CFSM)を導入する。
- 反射率、シャドー、および除霧損失を共同で最適化するマルチタスク学習の目的関数を用いて、ネットワークをエンドツーエンドで訓練する。
- 内在的画像分解を監視信号として活用し、最終的な除霧出力の品質と耐障害性を向上させる。
実験結果
リサーチクエスチョン
- RQ1ハイブリッド・ローカル・グローバル・トランスフォーマー・アーキテクチャは、局所的およびグローバル特徴学習のバランスを取ることで、標準的ビジョン・トランスフォーマーを上回る除霧性能を達成できるか?
- RQ2内在的画像分解(反射率とシャドー)の統合は、直接エンドツーエンド除霧と比較して、除霧画像の品質と一般化性能を向上させるか?
- RQ3補完的特徴選択モジュールは、複数の予測ヘッドから得られる最も情報量の多い特徴を効果的に特定・利用できるか?
- RQ4提案されたHyLoG-ViTは、既存のCNNおよびトランスフォーマー基盤モデルと比較して、計算複雑性をどの程度低減しつつ、除霧精度を維持または向上できるか?
- RQ5モデルは、非均一および夜間の曇りの強い画像を含む多様な除霧シナリオにどの程度一般化できるか?
主な発見
- 提案されたHyLoG-ViTは、均一および非均一除霧のための標準ベンチマークにおいて、最先端のCNNベースの除霧モデルと同等または優れた性能を達成している。
- 本ネットワークは、多くの既存モデルが失敗する可能性のある挑戦的なシナリオである夜間除霧においても、強力な一般化性能を示している。
- 内在的画像分解(反射率およびシャドー予測)の使用により、最終的なはぎれのない画像の品質を向上させる意味のある中間特徴が得られる。
- 補完的特徴選択モジュール(CFSM)は、特徴の利用を効果的に向上させ、最も関連性の高い特徴に注目することで、より優れた除霧結果をもたらしている。
- ハイブリッド・ローカル・グローバル設計により、標準的なグローバル自己アテンション機構と比較して計算複雑性が低減され、モデルの効率性が向上している。
- 広範なアブレーションスタディにより、二重パスアーキテクチャおよびCFSMを備えたマルチデコーダーフレームワークの各構成要素の有効性が確認されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。