Skip to main content
QUICK REVIEW

[論文レビュー] The Role of Pre-Training in High-Resolution Remote Sensing Scene Classification.

Vladimir Risojević, Vladan Stojnić|arXiv (Cornell University)|Nov 5, 2021
Remote-Sensing Image Classification参考文献 27被引用数 6
ひとこと要約

この論文は、高分解能リモートセンシング(HRRS)データセットからビジョンモデルをスクラッチで訓練すると、ImageNet事前学習モデルの微調整と同等の性能が得られることを示している。さらに、HRRSデータ上で直接学習された表現は、ImageNet表現よりも下流タスクへの転送に優れていることが示され、ドメイン適応的事前学習(ドメイン内データを用いた2段階目の事前学習段階)が最良の特徴を生み出すことを明らかにしている。

ABSTRACT

Due to the scarcity of labeled data, using models pre-trained on ImageNet is a de facto standard in remote sensing scene classification. Although, recently, several larger high resolution remote sensing (HRRS) datasets have appeared with a goal of establishing new benchmarks, attempts at training models from scratch on these datasets are sporadic. In this paper, we show that training models from scratch on several newer datasets yields comparable results to fine-tuning the models pre-trained on ImageNet. Furthermore, the representations learned on HRRS datasets transfer to other HRRS scene classification tasks better or at least similarly as those learned on ImageNet. Finally, we show that in many cases the best representations are obtained by using a second round of pre-training using in-domain data, i.e. domain-adaptive pre-training. The source code and pre-trained models are available at \url{https://github.com/risojevicv/RSSC-transfer.}

研究の動機と目的

  • 高分解能リモートセンシング(HRRS)データセットからスクラッチでビジョンモデルを訓練することにより、ImageNet微調整の性能に匹敵するかを評価すること。
  • ImageNet上で学習された表現と比較して、HRRSデータセット上で学習された表現の転送性を調査すること。
  • ドメイン内HRRSデータを用いた2段階目の事前学習が、特徴品質および下流タスクの性能を向上させるかを検討すること。
  • ドメイン内事前学習の有効性を実証することで、HRRSシーン分類の新しいベンチマークを確立すること。

提案手法

  • ResNets や Vision Transformers などのビジョンモデルを、EuroSAT、AID、WHU-OPT といった近年のHRRSデータセットからスクラッチで訓練すること。
  • 同じHRRSベンチマーク上で、ImageNet事前学習重みから微調整されたモデルと、スクラッチで訓練されたモデルの性能を比較すること。
  • 下流タスクでの微調整の前に、ImageNet重みをHRRSデータでさらに事前学習することでドメイン適応的事前学習を実施すること。
  • 複数のHRRSシーン分類データセットを用いて転送性能を評価し、表現の一般化能力を測定すること。
  • トップ1精度のような標準指標を用いて、異なる事前学習戦略の有効性を定量的に比較すること。

実験結果

リサーチクエスチョン

  • RQ1HRRSデータセットからスクラッチで訓練したモデルは、ImageNet事前学習モデルの微調整と同等の性能を達成するか?
  • RQ2HRRSデータ上で学習された表現の転送性は、ImageNet上で学習された表現と比べてどうか?
  • RQ3HRRSデータを用いた2段階目の事前学習が、特徴品質および下流タスクの性能をさらに向上させるか?
  • RQ4ImageNet微調整、HRRSのみの事前学習、ドメイン適応的事前学習のうち、どの戦略がHRRSシーン分類に最も優れた表現を生み出すか?

主な発見

  • 複数のHRRSシーン分類ベンチマークにおいて、HRRSデータセットからスクラッチで訓練したモデルは、ImageNet事前学習モデルの微調整と同等の性能を達成している。
  • HRRSデータ上で直接学習された表現は、ImageNet上で学習された表現と比較して、他のHRRSタスクへの転送性が同程度またはそれ以上に優れている。
  • ドメイン適応的事前学習(ImageNet重みをHRRSデータで事前学習した後、微調整する)は、評価されたすべてのデータセットで最も優れた特徴を生み出している。
  • モデルがドメイン内HRRSデータを用いた2段階目の事前学習段階を経ることで、常に最高の全体的性能が達成されており、ドメイン特化の事前学習が特徴品質を向上させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。