Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid Multiple Attention Network for Semantic Segmentation in Aerial Images

Ruigang Niu, Xian Sun|arXiv (Cornell University)|Jan 9, 2020
Advanced Image and Video Retrieval Techniques参考文献 45被引用数 15
ひとこと要約

本稿では、空間的、チャネル的、カテゴリーレベルのアテンションを統合して、非常に高解像度の航空画像におけるセマンティックセグメンテーションのための新しいアテンションベースのフレームワーク、Hybrid Multiple Attention Network (HMANet) を提案する。HMANet は、グローバルな依存関係を効率的にモデル化することで、ISPRS Vaihingen および Potsdam ベンチマークで最先端の性能を達成し、ResNet-101 を用いた平均 IoU 91.44% および総合正答率 92.21% を達成した。

ABSTRACT

Semantic segmentation in very high resolution (VHR) aerial images is one of the most challenging tasks in remote sensing image understanding. Most of the current approaches are based on deep convolutional neural networks (DCNNs). However, standard convolution with local receptive fields fails in modeling global dependencies. Prior researches have indicated that attention-based methods can capture long-range dependencies and further reconstruct the feature maps for better representation. Nevertheless, limited by the mere perspective of spacial and channel attention and huge computation complexity of self-attention mechanism, it is unlikely to model the effective semantic interdependencies between each pixel-pair of remote sensing data of complex spectra. In this work, we propose a novel attention-based framework named Hybrid Multiple Attention Network (HMANet) to adaptively capture global correlations from the perspective of space, channel and category in a more effective and efficient manner. Concretely, a class augmented attention (CAA) module embedded with a class channel attention (CCA) module can be used to compute category-based correlation and recalibrate the class-level information. Additionally, we introduce a simple yet effective region shuffle attention (RSA) module to reduce feature redundant and improve the efficiency of self-attention mechanism via region-wise representations. Extensive experimental results on the ISPRS Vaihingen and Potsdam benchmark demonstrate the effectiveness and efficiency of our HMANet over other state-of-the-art methods.

研究の動機と目的

  • 非常に高解像度の航空画像におけるセマンティックセグメンテーションのための長距離依存関係をモデル化する課題に対処すること。
  • 固定された局所的受容野を持つ標準的な畳み込みネットワークがグローバルコンテキストを捉えるのを制限する点を克服すること。
  • リモートセンシングのセグメンテーションで用いられる自己アテンション機構における計算複雑性と特徴の重複を低減すること。
  • クラス固有の特徴表現を向上させるためにカテゴリーレベルのアテンションを統合すること。これはピクセル単位分類において極めて重要である。
  • 空間的、チャネル的、カテゴリーレベルの視点を統合した、効率的かつ効果的なアテンション機構を構築し、セグメンテーション性能を向上させること。

提案手法

  • カテゴリーベースの相関を計算し、クラスレベルの特徴を再キャリブレーションするためのクラスチャネルアテンション(CCA)モジュールを統合したクラス補強アテンション(CAA)モジュールを提案する。
  • 領域ごとの表現を学習することで特徴の重複を低減し、自己アテンションの効率性を向上させるリージョンシャッフルアテンション(RSA)モジュールを導入する。
  • 空間的、チャネル的、カテゴリーレベルのアテンションを統合して、複数の視点からのグローバルコンテキストを捉えるハイブリッドアテンションフレームワークを設計する。
  • モデルの性能と効率性を異なるアーキテクチャで評価するために、VGG-16 および ResNet-101 をバックボーンとして使用する。
  • ISPRS Vaihingen および Potsdam データセットを用いて、標準プロトコルに従い、最先端の手法と比較してモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1空間的、チャネル的、カテゴリーレベルの視点を統合したハイブリッドアテンション機構は、航空画像におけるセマンティックセグメンテーションを向上させることができるか?
  • RQ2提案されたクラス補強アテンション(CAA)モジュールは、標準的な空間的・チャネル的アテンションと比較して、どのようにクラスレベルの特徴表現を向上させるか?
  • RQ3リモートセンシングデータにおける自己アテンションの計算複雑性と特徴の重複を、リージョンシャッフルアテンション(RSA)モジュールはどの程度低減するか?
  • RQ4複数のアテンション視点を統合することで、Vaihingen や Potsdam のような多様な航空画像データセットにおいて一貫した性能向上が得られるか?
  • RQ5非常に高解像度の航空画像のセマンティックセグメンテーションにおいて、HMANet は既存の最先端手法と比較して、精度と効率性の両面で優れているか?

主な発見

  • ResNet-101 をバックボーンとして使用した HMANet は、ISPRS Vaihingen テストセットで平均 IoU 91.44% を達成し、以前の最先端手法を上回った。
  • Potsdam データセットでは、HMANet は全体正答率 92.21% および平均 IoU 87.28% を達成し、優れた性能と頑健性を示した。
  • Potsdam データセットでは、ResNet-101 を用いた HMANet が平均 F1 スコア 93.50% を達成し、DeepLabV3+ や PSPNet などのベースライン手法を顕著に上回った。
  • アブレーションスタディの結果、CAA と RSA モジュールの組み合わせが性能向上に寄与していることが確認され、CAA はクラスレベルの表現を向上させ、RSA は効率性を向上させた。
  • 視覚的な結果により、HMANet は以前の手法よりも優れたセグメンテーション品質を達成しており、境界検出の向上とノイズの低減が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。