Skip to main content
QUICK REVIEW

[論文レビュー] Change Detection in Multi-temporal VHR Images Based on Deep Siamese Multi-scale Convolutional Networks

Hongruixuan Chen, Chen Wu|arXiv (Cornell University)|Jun 27, 2019
Remote-Sensing Image Classification参考文献 74被引用数 16
ひとこと要約

本稿では、深層シアンズ畳み込みニューラルネットワーク内にマルチスケール特徴畳み込みユニット(MFCU)を組み込んだ、マルチタイムリーな非常に高解像度(VHR)画像における変化検出のための新規なディープラーニングフレームワークを提案する。本手法は、自己教師ありと教師ありのアーキテクチャ—DSMS-CN および DSMS-FCN—を採用し、特徴の微調整のために完全結合条件付きランダムフィールド(FC-CRF)を統合することで、パrameter数を削減しつつ、最先端の性能とリアルタイム推論を達成した。

ABSTRACT

Very-high-resolution (VHR) images can provide abundant ground details and spatial geometric information. Change detection in multi-temporal VHR images plays a significant role in urban expansion and area internal change analysis. Nevertheless, traditional change detection methods can neither take full advantage of spatial context information nor cope with the complex internal heterogeneity of VHR images. In this paper, a powerful feature extraction model entitled multi-scale feature convolution unit (MFCU) is adopted for change detection in multi-temporal VHR images. MFCU can extract multi-scale spatial-spectral features in the same layer. Based on the unit two novel deep siamese convolutional neural networks, called as deep siamese multi-scale convolutional network (DSMS-CN) and deep siamese multi-scale fully convolutional network (DSMS-FCN), are designed for unsupervised and supervised change detection, respectively. For unsupervised change detection, an automatic pre-classification is implemented to obtain reliable training samples, then DSMS-CN fits the statistical distribution of changed and unchanged areas from selected training samples through MFCU modules and deep siamese architecture. For supervised change detection, the end-to-end deep fully convolutional network DSMS-FCN is trained in any size of multi-temporal VHR images, and directly outputs the binary change map. In addition, for the purpose of solving the inaccurate localization problem, the fully connected conditional random field (FC-CRF) is combined with DSMS-FCN to refine the results. The experimental results with challenging data sets confirm that the two proposed architectures perform better than the state-of-the-art methods.

研究の動機と目的

  • 従来のVHR画像における変化検出手法の限界、特に空間的・スペクトル的文脈を十分に活用できないこと、および内部の不均一性に対処できないことに対処する。
  • VHR画像におけるマルチスケールの空間的・スペクトル的パターンを捉えるために、低レベル特徴抽出と単一スケール畳み込みユニットの欠陥を克服する。
  • マルチタイムリーなVHR画像における正確で効率的かつリアルタイムの変化検出を可能にするエンドツーエンドのディープラーニングフレームワークを開発する。
  • 深層学習ベースの変化検出におけるセグメンテーション境界の微調整と局所化精度の向上のため、FC-CRFを統合する。
  • MFCUモジュールの汎用性と効率性を示すために、性能向上とモデルサイズの縮小を伴いながら、さまざまなネットワークアーキテクチャに組み込むことで、その有効性を検証する。

提案手法

  • 1×1、3×3、5×5の畳み込みカーネルに加え、3×3のマックスプーリングを1層で同時に使用するマルチスケール特徴畳み込みユニット(MFCU)を導入し、マルチスケールの空間的・スペクトル的特徴を抽出する。
  • 自己教師あり変化検出を目的とした深層シアンズマルチスケール畳み込みネットワーク(DSMS-CN)を設計し、自動的に事前分類されたサンプルを用いて、変化領域と不変領域の統計的分布に適合させる。
  • 教師あり変化検出を目的とした深層シアンズマルチスケール完全畳み込みネットワーク(DSMS-FCN)を提案し、パッチベースのスライディングウィンドウを用いずに、任意のサイズの画像を処理可能にする。
  • DSMS-FCNが出力するバイナリ変化マップを微調整するために、完全結合条件付きランダムフィールド(FC-CRF)をポストプロセッシングモジュールとして適用し、ネットワーク出力をユニタリポテンシャルとして使用する。
  • DSMS-FCNをACDデータセットでエンドツーエンドに学習し、Szada-1およびTisza-3を含む複数のベンチマークデータセットで性能を検証する。
  • 既存のFCNアーキテクチャに標準的な単一スケール畳み込みユニットの代わりにMFCUを統合することで、特徴表現を向上させるとともに、モデルの複雑さを低減する。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール特徴畳み込みユニット(MFCU)は、1つの畳み込み層内でVHR画像の複数スケールの空間的・スペクトル的特徴を効果的に捉えることができるか?
  • RQ2提案された深層シアンズアーキテクチャ(DSMS-CN)は、挑戦的なVHR画像データセットにおいて、既存の自己教師あり変化検出手法を上回る性能を示すか?
  • RQ3エンドツーエンドのDSMS-FCNアーキテクチャは、計算コストを低く抑えながら、教師あり変化検出で優れた性能を達成し、リアルタイム推論を実現できるか?
  • RQ4DSMS-FCNにFC-CRFを統合することで、変化検出結果の局所化精度と境界の正確さはどの程度向上するか?
  • RQ5MFCUベースのアーキテクチャは、従来の単一スケール畳み込みユニットおよび既存のSOTAモデルと比較して、パrameter効率性と性能の両面で優れているか?

主な発見

  • Tiszadob-3データセットにおいて、MSFC-EF-FCCRFはF1スコア0.9638、OA 0.9874、KC 0.9560を達成し、DSCN、CXM、SCCN、FC-EF、FC-Siam-Conc、FC-Siam-Diffを含むすべての比較手法を上回った。
  • ACDデータセットではDSMS-FCNがF1スコア0.8690、OA 0.9552を達成し、MSFC-EFが追加の微調整により優れた性能を示すものの、競争力のある性能を示した。
  • MSFC-EFモデルは、FC-EFと比較してモデルサイズを14.5%削減したが、Szada-1およびTisza-3データセットの両方でOAおよびF1スコアを向上させた。
  • DSMS-FCNは、FC-Siam-ConcおよびFC-Siam-Diffと比較して、学習可能なパラメータ数をそれぞれ46.9%および38.4%削減したが、より優れた性能を達成した。
  • DSMS-FCNの推論時間は1画像あたり0.1秒未満であり、FC-CRFの推論時間も1画像あたり1秒未満であったため、マルチタイムリーなVHR画像のリアルタイム処理が可能となった。
  • DSMS-FCNにFC-CRFを統合することで、F1スコアは0.8690から0.8886に、OAは0.9552から0.9620に向上し、境界局所化の微調整における有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。