Skip to main content
QUICK REVIEW

[論文レビュー] Transformer Meets Convolution: A Bilateral Awareness Network for Semantic Segmentation of Very Fine Resolution Urban Scene Images

Libo Wang, Rui Li|arXiv (Cornell University)|Jun 23, 2021
Automated Road and Building Extraction参考文献 55被引用数 9
ひとこと要約

本稿では、Transformerに基づく長距離依存関係モデリングと畳み込み特徴抽出を統合することで、非常に高解像度(VFR)の都市シーン画像における意味的セグメンテーションを向上させる、新しいアーキテクチャ「Bilateral Awareness Network(BANet)」を提案する。線形自己注意を用いた特徴融合モジュールと、ResTに基づく依存関係パスおよびスタックされた畳み込みテクスチャパスを統合することで、UAVidデータセット上で64.6%のmIoUを達成し、大規模な都市セグメンテーションベンチマークで最先端の性能を示した。

ABSTRACT

Semantic segmentation from very fine resolution (VFR) urban scene images plays a significant role in several application scenarios including autonomous driving, land cover classification, and urban planning, etc. However, the tremendous details contained in the VFR image, especially the considerable variations in scale and appearance of objects, severely limit the potential of the existing deep learning approaches. Addressing such issues represents a promising research field in the remote sensing community, which paves the way for scene-level landscape pattern analysis and decision making. In this paper, we propose a Bilateral Awareness Network which contains a dependency path and a texture path to fully capture the long-range relationships and fine-grained details in VFR images. Specifically, the dependency path is conducted based on the ResT, a novel Transformer backbone with memory-efficient multi-head self-attention, while the texture path is built on the stacked convolution operation. Besides, using the linear attention mechanism, a feature aggregation module is designed to effectively fuse the dependency features and texture features. Extensive experiments conducted on the three large-scale urban scene image segmentation datasets, i.e., ISPRS Vaihingen dataset, ISPRS Potsdam dataset, and UAVid dataset, demonstrate the effectiveness of our BANet. Specifically, a 64.6% mIoU is achieved on the UAVid dataset. Code is available at https://github.com/WangLibo1995/GeoSeg.

研究の動機と目的

  • 極めてスケールや外観の変動が激しいため、従来のディーブラーニングモデルが困難である非常に高解像度(VFR)の都市シーン画像における意味的セグメンテーションの課題に対処すること。
  • 高解像度のリモートセンシング画像において、長距離の文脈的依存関係と微細な局所的特徴の両方を捉えることが難しい現行モデルの限界を克服すること。
  • Transformerと畳み込みネットワークの長所を効果的に統合する統一されたネットワークアーキテクチャを設計し、都市環境におけるシーンレベルの理解を向上させること。
  • ISPRS Vaihingen、Potsdam、UAVidを含む大規模で現実世界の都市セグメンテーションデータセット上で、提案手法の有効性を検証すること。

提案手法

  • ネットワークは二重パス設計を採用:長距離空間的依存関係をモデル化するため、マルチヘッド自己注意を備えたメモリ効率の良いTransformerバックボーンであるResTに基づく依存関係パスを採用する。
  • 別個のテクスチャパスは、スタックされた畳み込み層を用いて構築され、VFR画像からの微細な局所的特徴の保持と抽出が行われる。
  • 依存関係パスとテクスチャパスからの特徴を効果的に統合するため、線形自己注意に基づく特徴集約モジュールを導入し、計算コストを低減しながら性能を維持する。
  • 融合機構は、両パスからの補完的表現に動的に注目することで、下流のセグメンテーションのための特徴表現を強化する。
  • 標準的な交差エントロピー損失とDice損失の目的関数を用いて、3つの大規模な都市セグメンテーションデータセット上でエンドツーエンドで学習する。
  • 空間的リダクションと特徴精錬モジュールを備えることで、高解像度入力に対応したアーキテクチャ設計がなされ、解像度と詳細の維持が図られる。

実験結果

リサーチクエスチョン

  • RQ1Transformerと畳み込みを組み合わせた二重パスネットワークは、非常に高解像度の都市シーン画像における意味的セグメンテーション精度を向上させることができるか?
  • RQ2メモリ効率の良いTransformerバックボーン(例:ResT)は、高解像度リモートセンシングデータにおいて長距離依存関係を効果的に捉えることができるか?
  • RQ3長距離依存関係特徴と局所的テクスチャ特徴を統合することで、複雑な都市シーンにおけるセグメンテーション性能がどの程度向上するか?
  • RQ4提案された線形自己注意に基づく融合機構は、特徴統合において標準的な連結や要素ごとの演算を上回る効果を示すか?

主な発見

  • BANetはUAVidデータセットで64.6%の平均交差率(mIoU)を達成し、非常に高解像度の都市シーンにおける意味的セグメンテーションの分野で、新たな最先端の性能を確立した。
  • ISPRS VaihingenおよびPotsdamデータセットでも優れた性能を示し、多様な都市環境や画像解像度にわたる一般化能力を確認した。
  • アブレーションスタディの結果、依存関係パス(ResT)とテクスチャパス(畳み込み)の両方が最終的な性能に顕著な貢献をしていることが明らかになった。
  • 線形自己注意融合モジュールにより、計算複雑性が低減された一方で、高い特徴表現品質を維持でき、高解像度入力に適した効率性を実現した。
  • Transformerと畳み込みの統合により、都市シーンにおけるスケール変動やオブジェクト外観の多様性の処理が改善された。
  • 異なる都市データセットにわたる一般化性能が高く、リモートセンシング画像におけるドメインシフトに対しても頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。