Skip to main content
QUICK REVIEW

[論文レビュー] Geographical Knowledge-driven Representation Learning for Remote Sensing Images

Wenyuan Li, Keyan Chen|arXiv (Cornell University)|Jul 12, 2021
Remote-Sensing Image Classification参考文献 73被引用数 73
ひとこと要約

本稿では、GlobeLand30の土地被覆データと地理的位置を弱い教師信号として活用し、深層ネットワークの事前学習を行う地理的知識駆動型表現学習手法GeoKRを提案する。解像度や撮影時刻の不一致に起因するノイズを軽減するため、Mean Teacherフレームワークを採用することで、画像分類、セマンティックセグメンテーション、曇り/雪検出といった下流タスクで最先端の性能を達成し、アノテーションの必要を著しく削減する。ImageNet事前学習や自己教師学習手法を上回り、ラベル付きデータを最大50%削減した状態でも性能を発揮する。

ABSTRACT

The proliferation of remote sensing satellites has resulted in a massive amount of remote sensing images. However, due to human and material resource constraints, the vast majority of remote sensing images remain unlabeled. As a result, it cannot be applied to currently available deep learning methods. To fully utilize the remaining unlabeled images, we propose a Geographical Knowledge-driven Representation learning method for remote sensing images (GeoKR), improving network performance and reduce the demand for annotated data. The global land cover products and geographical location associated with each remote sensing image are regarded as geographical knowledge to provide supervision for representation learning and network pre-training. An efficient pre-training framework is proposed to eliminate the supervision noises caused by imaging times and resolutions difference between remote sensing images and geographical knowledge. A large scale pre-training dataset Levir-KR is proposed to support network pre-training. It contains 1,431,950 remote sensing images from Gaofen series satellites with various resolutions. Experimental results demonstrate that our proposed method outperforms ImageNet pre-training and self-supervised representation learning methods and significantly reduces the burden of data annotation on downstream tasks such as scene classification, semantic segmentation, object detection, and cloud / snow detection. It demonstrates that our proposed method can be used as a novel paradigm for pre-training neural networks. Codes will be available on https://github.com/flyakon/Geographical-Knowledge-driven-Representaion-Learning.

研究の動機と目的

  • 無作為なリモートセンシング画像の数百万枚を活用して、ラベル付きリモートセンシングデータの不足を解消すること。
  • 画像分類、セマンティックセグメンテーション、オブジェクト検出、曇り/雪検出といった下流タスクにおけるディープラーニングの性能を向上させること。
  • 地理的知識を弱い教師信号として事前学習に活用することで、アノテーションの負担を軽減すること。
  • リモートセンシング画像と地理的知識の間の解像度および撮影時刻の差異に起因するノイズを緩和する、耐障害性の高い事前学習フレームワークの構築

提案手法

  • GlobeLand30のグローバル土地被覆製品と地理座標を地理的知識として用い、監視信号を生成する。
  • 土地被覆タイプを埋め込みベクトルにマッピングすることで、知識表現を構築し、監視に活用する。
  • 重み平均化を用いた二重ネットワーク構造(学生と教師)を採用し、訓練の安定化と画像-知識の不一致に起因するノイズ低減を実現する。
  • 事前学習中に、画像表現と知識表現を一致させるためにKLダイバージェンス損失を適用する。
  • 教師ネットワークを介して対照学習戦略を導入し、特徴の一般化性能と耐性を向上させる。
  • 事前学習用に、複数の解像度を持つ1,431,950枚のGaoFen衛星画像を含むLevir-KRデータセットを構築する。

実験結果

リサーチクエスチョン

  • RQ1土地被覆や位置といった地理的知識が、リモートセンシング画像における表現学習の監視に効果的に活用可能か。
  • RQ2リモートセンシング画像と地理的知識の間の解像度および撮影時刻の差異に起因するノイズを、事前学習段階でどのように緩和できるか。
  • RQ3GeoKRは、下流タスクにおけるアノテーションデータの必要性をどの程度まで低減できるか。
  • RQ4GeoKRは、ImageNet事前学習や自己教師学習手法を下回らない下流タスク性能を発揮するか。

主な発見

  • GeoKRは、画像分類、セマンティックセグメンテーション、オブジェクト検出、曇り/雪検出を含む、すべての下流タスクでImageNet事前学習および自己教師学習手法(MoCo、SimCLR、BYOL)を上回る性能を発揮する。
  • RSSCN7データセットにおいて、GeoKR(ResNet50)は100%の学習データを使用した場合に94.19%の正確度を達成し、ベースラインを2%以上上回る。
  • Vaihingenにおけるセマンティックセグメンテーションでは、GeoKR(ResNet50)が100%のデータで72.68%の正確度を達成し、ベースライン比で2.5%の向上を示す。
  • 学習データの20%のみを用いても、GeoKRはImageNet事前学習で100%のデータを使用した場合と同等の性能を達成し、画像分類タスクにおけるアノテーションの必要を半減させる。
  • 雪検出タスクでは、限られたデータを用いた場合に10%以上の性能向上を達成し、優れたデータ効率性を示す。
  • アブレーションスタディの結果、教師ネットワークと知識表現が重要な構成要素であり、教師モデルが最良の結果をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。