Skip to main content
QUICK REVIEW

[論文レビュー] Towards Deep and Efficient: A Deep Siamese Self-Attention Fully Efficient Convolutional Network for Change Detection in VHR Images

Hongruixuan Chen, Chen Wu|arXiv (Cornell University)|Aug 18, 2021
Remote-Sensing Image Classification参考文献 53被引用数 6
ひとこと要約

この論文は、非常に高解像度(VHR)リモートセンシング画像における変化検出のための、深くかつ効率的な完全畳み込みシアン方式ネットワークであるEffCDNetを提案する。標準畳み込みを効率的畳み込みモジュールに置き換え、軽量な再帰的クロスクロス自己注意デコーダーを採用することで、ベンチマークレベルのパrameter数で最先端の精度を達成するとともに、顕著に低い計算コストを実現した。さらに、情報エントロピーに基づく2つの新しい損失関数が、曖昧な画素における性能を向上させた。

ABSTRACT

Recently, FCNs have attracted widespread attention in the CD field. In pursuit of better CD performance, it has become a tendency to design deeper and more complicated FCNs, which inevitably brings about huge numbers of parameters and an unbearable computational burden. With the goal of designing a quite deep architecture to obtain more precise CD results while simultaneously decreasing parameter numbers to improve efficiency, in this work, we present a very deep and efficient CD network, entitled EffCDNet. In EffCDNet, to reduce the numerous parameters associated with deep architecture, an efficient convolution consisting of depth-wise convolution and group convolution with a channel shuffle mechanism is introduced to replace standard convolutional layers. In terms of the specific network architecture, EffCDNet does not use mainstream UNet-like architecture, but rather adopts the architecture with a very deep encoder and a lightweight decoder. In the very deep encoder, two very deep siamese streams stacked by efficient convolution first extract two highly representative and informative feature maps from input image-pairs. Subsequently, an efficient ASPP module is designed to capture multi-scale change information. In the lightweight decoder, a recurrent criss-cross self-attention (RCCA) module is applied to efficiently utilize non-local similar feature representations to enhance discriminability for each pixel, thus effectively separating the changed and unchanged regions. Moreover, to tackle the optimization problem in confused pixels, two novel loss functions based on information entropy are presented. On two challenging CD datasets, our approach outperforms other SOTA FCN-based methods, with only benchmark-level parameter numbers and quite low computational overhead.

研究の動機と目的

  • VHR画像における変化検出において、モデルの深さと計算効率のトレードオフを解消すること。
  • パフォーマンスを損なわず、深く完全畳み込みネットワーク(FCN)のパrameter数と計算コストを低減すること。
  • 情報エントロピーに基づく新しい損失関数を用いて、曖昧または混乱しやすい画素の検出を向上させること。
  • 強化された特徴表現と効率性を実現する、非常に深いエンコーダーと軽量なデコーダーを持つネットワークアーキテクチャを設計すること。
  • 最小限のモデル複雑性で、挑戦的なオープンデータセットにおいて優れた性能を示すこと。

提案手法

  • EffCDNetは、標準畳み込み層を、深度方向畳み込み、グループ畳み込み、チャネルシャッフルを組み合わせた効率的畳み込みモジュールに置き換える。
  • ネットワークは、2つの深く同一のスレッドを持つシアンエンコーダーを用い、時系列画像ペアからの階層的特徴を抽出する。
  • 深層特徴マップに差分演算を適用し、変化情報を豊富に含む差分マップを生成する。
  • 効率的畳み込みを用いた拡張畳み込み(dilated convolutions)を用いた効率的アトラス空間的プール(EASPP)モジュールにより、マルチスケールの変化特徴を捉える。
  • 再帰的クロスクロス自己注意(RCCA)モジュールを用いた軽量デコーダーが、長距離依存関係を効率的にモデル化することで特徴の識別性を向上させる。
  • トレーニング中に曖昧または混乱しやすい画素の最適化を改善するために、2つの新しい情報エントロピーに基づく損失関数(IEL1およびIEW)を導入する。

実験結果

リサーチクエスチョン

  • RQ1VHR変化検出において、パフォーマンスを損なわず非常に深い完全畳み込みネットワークを計算的に効率化できるか?
  • RQ2深く完全畳み込みネットワークのパrameter数とFLOPsを、精度を維持または向上させながら低減できるか?
  • RQ3効率的畳み込みと軽量デコーダーを備えたシアンエンコーダーは、標準的なUNet型アーキテクチャを上回る性能を達成できるか?
  • RQ4情報エントロピーに基づく損失関数は、変化検出における曖昧または混乱しやすい画素の最適化を向上させられるか?
  • RQ5提案されたRCCAモジュールは、標準的な自己注意よりも特徴の識別性をより効率的に向上させられるか?

主な発見

  • EffCDNetは116層の深さを有し、多くの既存手法よりも顕著に深いが、ベンチマークモデルとほとんど同じパrameter数を維持している。
  • SVCDおよびBCDデータセットにおいて、EffCDNetはすべての最先端のFCNベース手法を、精度と視覚的品質の両面で上回った。
  • IEL1損失で学習した場合、BCDデータセットにおける平均F1スコアは80.41%に達し、交差エントロピー損失を上回った。
  • 情報エントロピーに基づく損失関数は、クラス内均一性が高く、境界局在性に優れたエントロピー地図を生成し、曖昧な画素の最適化が改善されたことを示した。
  • RCCAモジュールは、標準的な自己注意よりも特徴の識別性をより効率的に向上させ、計算コストを低く抑えながら変化検出性能を向上させた。
  • 提案されたエントロピーに基づく損失関数は汎用性が高く、EffCDNetだけでなく、FC-EFやIFNなどの他のモデルに対しても性能向上をもたらした。これは広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。