Skip to main content
QUICK REVIEW

[論文レビュー] Deep learning for semantic segmentation of remote sensing images with rich spectral content

Amina Ben Hamida, Alexandre Benoît|arXiv (Cornell University)|Dec 5, 2017
Remote-Sensing Image Classification参考文献 5被引用数 8
ひとこと要約

本稿では、多スペクトルSentinel-2画像の意味的セグメンテーションのための3次元DenseNetおよび2次元ディープラーニングアーキテクチャを提案し、ノイズが混入した低解像度のGlobCoverラベルを用いて性能を評価している。粗大スケールの推定において、SegNetのような深層ネットワークを用いることで最大83.9%の精度を達成した一方で、3次元モデルは深さが増すにつれて性能が向上するが、より多くのデータを必要とすることから、リモートセンシングセグメンテーションにおける解像度とラベル品質のトレードオフが浮き彫りになった。

ABSTRACT

With the rapid development of Remote Sensing acquisition techniques, there is a need to scale and improve processing tools to cope with the observed increase of both data volume and richness. Among popular techniques in remote sensing, Deep Learning gains increasing interest but depends on the quality of the training data. Therefore, this paper presents recent Deep Learning approaches for fine or coarse land cover semantic segmentation estimation. Various 2D architectures are tested and a new 3D model is introduced in order to jointly process the spatial and spectral dimensions of the data. Such a set of networks enables the comparison of the different spectral fusion schemes. Besides, we also assess the use of a " noisy ground truth " (i.e. outdated and low spatial resolution labels) for training and testing the networks.

研究の動機と目的

  • 豊富なスペクトル情報を有する多スペクトルリモートセンシング画像の意味的セグメンテーションのためのディープラーニングアーキテクチャを評価すること。
  • 空間的およびスペクトル的次元を同時に処理する2次元および3次元畳み込みニューラルネットワークアーキテクチャの比較。
  • GlobCover 2009(300m解像度)のようなノイズ混入・古くさい・低解像度の正例ラベルを用いたディープネットワークのトレーニングおよびテストの可能性を調査すること。
  • 限られたデータとノイズ混入した正例ラベル下での、細粒度および粗大スケールの土地被覆推定の性能差を評価すること。
  • Sentinel-2データを用いて、スペクトル統合戦略およびモデルの深さがセグメンテーション精度に与える影響を調査すること。

提案手法

  • 空間的・スペクトル的特徴を統合的に学習するため、2次元および3次元畳み込みニューラルネットワーク(DenseNetおよびSegNetの変種を含む)を用いて多スペクトル画像を処理する。
  • 空間的およびスペクトル的データの3次元ボリュームを同時に処理する3次元フィルタを適用する、新規の3次元DenseNetアーキテクチャを導入し、マルチバンド特徴の階層的統合を可能にする。
  • エンコーダ層からのスキップ接続を用いて、高解像度でのセグメンテーションマップを精緻化する、マルチスケールのデコーディングパスをSegNetおよびDenseNetの変種に適用する。
  • スペクトル統合を、バンドごとの2次元特徴マップを事前に連結する方法(早期統合)または空間的およびスペクトル的次元を一括して処理するエンドツーエンドの3次元畳み込みを用いる。
  • 20m解像度のインタポレーション済みSentinel-2画像を300m解像度のGlobCoverラベルと比較してトレーニングし、ノイズ混入・粗大な正例を模擬する。
  • 2つのデータセット(D1:雲を除く、D2:雲を別クラスとして含む)を用いてモデルを評価し、フランス、スイス、イタリアをカバーする地域を対象とする。

実験結果

リサーチクエスチョン

  • RQ13次元畳み込みネットワークは、多スペクトルリモートセンシング画像の意味的セグメンテーションにおいて、空間的・スペクトル的特徴を統合的に活用できるか?
  • RQ2ノイズ混入・低解像度の正例(例:300mのGlobCover)を用いたトレーニングが、土地被覆セグメンテーションにおけるディープラーニングモデルの性能に与える影響は何か?
  • RQ3高解像度入力ではあるが、ラベルが粗大な場合の、細粒度と粗大スケール推定の性能トレードオフは何か?
  • RQ4早期2次元統合とエンドツーエンド3次元畳み込みという異なるスペクトル統合戦略が、セグメンテーション精度に与える影響は何か?
  • RQ5限られたデータとノイズ混入したデータセットでトレーニングされた場合、SegNet や DenseNet といったディープアーキテクチャがどれほど精度を維持できるか?

主な発見

  • D1データセット(長期間、雲なし)ではSegNetによる粗大スケールの土地被覆推定で66.9%の全体精度を達成し、D2データセット(短期間、雲あり)では83.9%に達した。これは、安定した時間的条件下での優れた性能を示している。
  • 3次元DenseNetモデル(深さ $e[4,4,4]_{3D}$, $d[4,4,4]$ および $g16$)はD2データセットで41.2%の精度を示した。深さが増すにつれて性能が向上するが、十分なトレーニングデータがなければ限界に達する。
  • 3次元モデルを用いた細粒度推定では、D1で25.1%~30.0%、D2で39.5%~57.9%の精度を示した。ノイズ混入ラベル下では高解像度トレーニングが困難であることが示された。
  • 「人工表面」「裸地」「水体」「雲」などのクラスは良好に検出されたが、「雨季耕地」と「モザイク耕地/植生」のような類似クラスは、ラベルのノイズのためしばしば混同された。
  • SegNetにおけるマルチスケール予測と平均化処理により、境界エラーが低減され、特に正例が粗大な場合のロバスト性が向上した。
  • より深い3次元モデルでは性能向上が見られたが、特に細粒度セグメンテーションでは学習の安定化に大幅に多くのデータが必要となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。