Skip to main content
QUICK REVIEW

[論文レビュー] Remote Sensing Image Scene Classification with Self-Supervised Paradigm under Limited Labeled Samples

Chao Tao, Ji Qi|arXiv (Cornell University)|Oct 2, 2020
Remote-Sensing Image Classification参考文献 18被引用数 5
ひとこと要約

本論文は、限られたラベル付きデータ下で、自己教師あり学習(SSL)を用いたリモートセンシング画像(RSI)シーン分類のためのパラダイムを提案する。この手法は、事前学習のための事前学習タスクを用いて大規模なラベルなしRSIデータ上で深層ニューラルネットワークを事前学習させ、ラベル付きデータが限られた状況下でもImageNet事前学習を大きく上回る性能を達成する。本手法は、3つのベンチマークデータセットで最先端の性能を達成し、特にラベル付きサンプルが少ない状況下で、ドメインシフトを低減し、特徴の一般化能力を向上させることで優れた性能を発揮する。

ABSTRACT

With the development of deep learning, supervised learning methods perform well in remote sensing images (RSIs) scene classification. However, supervised learning requires a huge number of annotated data for training. When labeled samples are not sufficient, the most common solution is to fine-tune the pre-training models using a large natural image dataset (e.g. ImageNet). However, this learning paradigm is not a panacea, especially when the target remote sensing images (e.g. multispectral and hyperspectral data) have different imaging mechanisms from RGB natural images. To solve this problem, we introduce new self-supervised learning (SSL) mechanism to obtain the high-performance pre-training model for RSIs scene classification from large unlabeled data. Experiments on three commonly used RSIs scene classification datasets demonstrated that this new learning paradigm outperforms the traditional dominant ImageNet pre-trained model. Moreover, we analyze the impacts of several factors in SSL on RSIs scene classification tasks, including the choice of self-supervised signals, the domain difference between the source and target dataset, and the amount of pre-training data. The insights distilled from our studies can help to foster the development of SSL in the remote sensing community. Since SSL could learn from unlabeled massive RSIs which are extremely easy to obtain, it will be a potentially promising way to alleviate dependence on labeled samples and thus efficiently solve many problems, such as global mapping.

研究の動機と目的

  • 深層学習を用いたシーン分類において、ラベル付きリモートセンシング画像(RSI)が限られているという課題に対処すること。
  • マルチスペクトル/ハイパースペクトルRSIに対してImageNetで事前学習したモデルを微調整する際の固有のドメインシフト問題を克服すること。
  • ラベルなしRSIデータを用いて、強固で転移可能な表現を学習する自己教師あり事前学習フレームワークを開発すること。
  • 自己教師あり信号、ドメインの違い、事前学習データ量がRSIシーン分類性能に与える影響を調査すること。
  • 高価な人為的ラベル付きデータに依存しない、より効果的なRSIシーン分類の新しいパラダイムを確立すること。

提案手法

  • 同じ画像の拡張されたビューから得られる正例と負例のペアを対比するため、自己教師あり学習のコアな事前学習タスクとしてインスタンス識別を採用する。
  • 対照的学習の目的関数を用いて、大規模なラベルなしRSIデータセット(例:EuroSAT、AID、NR)上でResNetベースのエンコーダーを事前学習する。
  • 事前学習済みエンコーダーの重みを固定し、小規模なラベル付きターゲットデータセット上で最終全結合層のみを微調整する。
  • ランダムクロッピング、カラージャンブル、ガウスノイズを用いたデータ増強戦略を用いて、正例および負例のビューを生成する。
  • 200エポックにわたりコサインスケジュールを用いた学習率スケジューリングとバッチサイズ64で最適化を実行する。
  • アブレーションスタディにおいて、SVMを用いて抽出された特徴量の分類を実行し、SSLベースの手法とImageNet事前学習、MATAR GANsを比較する。

実験結果

リサーチクエスチョン

  • RQ1限られたラベル付きデータ下で、ラベルなしRSIデータに対する自己教師あり学習が、ImageNet事前学習よりも優れた表現を生み出せるか?
  • RQ2自己教師あり信号の選択(例:インスタンス識別)が、下流のRSIシーン分類タスクの性能に与える影響はいかほどか?
  • RQ3ソース(事前学習)とターゲット(微調整)データセット間のドメイン差異が、自己教師ありモデルの性能にどの程度影響を及えるか?
  • RQ4事前学習データ量が、RSIシーン分類における自己教師あり表現の一般化能力に与える影響はどの程度か?
  • RQ5本手法のSSLは、従来の事前学習アプローチと比較して、小規模なラベル付きデータ環境においてより頑健であるか?

主な発見

  • 提案されたインスタンス識別に基づくSSL手法は、3つのデータセット(EuroSAT、AID、NR)すべてにおいてImageNet事前学習を上回る性能を発揮し、特にラベル付きデータが極めて少ない状況で顕著な優位性を示す。
  • NRデータセット(クラス1つあたり5ラベル)では、IDSSLが全体正確度80.63%を達成したのに対し、ImageNet事前学習済みResNet50は59.63%にとどまった。
  • クラス1つあたりのラベル数が20から5に減少した場合、IDSSLの性能低下は6.02%にとどまったが、ImageNetとMATAR GANsはそれぞれ19.13%および26.24%低下した。
  • NRデータセットから25,200枚のラベルなしサンプルを用いた事前学習で80.63%のOAが達成され、限られた監視下でも高い性能を示した。
  • AID、NR、EuroSATの3つのデータセットの事前学習データを統合した場合、AIDでは84.20%のOA、NRでは81.13%のOAを達成した。
  • 研究により、事前学習データとターゲットデータの間のドメイン整合性が極めて重要であり、SSLはImageNet事前学習よりもドメインシフトをより効果的に緩和することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。