Skip to main content
QUICK REVIEW

[論文レビュー] Representation Learning for Remote Sensing: An Unsupervised Sensor Fusion Approach

Aidan Swope, Xander Rudelis|arXiv (Cornell University)|Aug 11, 2021
Remote-Sensing Image Classification被引用数 8
ひとこと要約

本稿では、ランダムなチャネル/センサーのドロップアウトによって生成されるビュー同士を対比することで、任意の組み合わせのマルチセンサー遠隔測定データから意味的な表現を学ぶ自己教師あり手法である対照的センサー融合(CSF)を提案する。4700万件のラベルなしコテルミナス画像トリプレットで訓練されたCSF表現は、遠隔測定分類タスクにおいてImageNet教師あり特徴量を上回り、追加のセンサー入力を通じて性能が単調に向上し、融合された場合、高解像度単一センサーをも上回ることすらある。

ABSTRACT

In the application of machine learning to remote sensing, labeled data is often scarce or expensive, which impedes the training of powerful models like deep convolutional neural networks. Although unlabeled data is abundant, recent self-supervised learning approaches are ill-suited to the remote sensing domain. In addition, most remote sensing applications currently use only a small subset of the multi-sensor, multi-channel information available, motivating the need for fused multi-sensor representations. We propose a new self-supervised training objective, Contrastive Sensor Fusion, which exploits coterminous data from multiple sources to learn useful representations of every possible combination of those sources. This method uses information common across multiple sensors and bands by training a single model to produce a representation that remains similar when any subset of its input channels is used. Using a dataset of 47 million unlabeled coterminous image triplets, we train an encoder to produce semantically meaningful representations from any possible combination of channels from the input sensors. These representations outperform fully supervised ImageNet weights on a remote sensing classification task and improve as more sensors are fused. Our code is available at https://storage.cloud.google.com/public-published-datasets/csf_code.zip.

研究の動機と目的

  • ピクセル単位のアノテーションが高コストかつ時間のかかる遠隔測定分野におけるラベルデータの不足に取り組む。
  • 空間的ばらつきが大きく、シーン構成が複雑である遠隔測定に不適切な既存の自己教師あり手法の限界を克服する。
  • すべての可能なセンサー組み合わせに一般化可能な統一表現を学習することで、マルチセンサー・マルチチャネルデータの有効な統合を可能にする。
  • 微調整なしで下流タスクに有用な分離可能でセンサーに依存しない特徴量を学習する手法を開発する。

提案手法

  • 同じシーンの2つのビューを形成するために、異なるセンサーからの入力チャネルをランダムにドロップさせることで、類似した表現を促す対照的損失を用いて1つのエンコーダーを訓練する。
  • 各4バンドを有する3つの光学センサー(SPOT、NAIP、Pléiades)のコテルミナス画像トリプレットを用い、合計12入力チャネルとする。
  • 利用可能なセンサーからのチャネルのサブセットをランダムに選択することで、1シーンあたり2つのビューを形成し、両ビューが同じ根本的なシーンコンテキストを共有することを保証する。
  • 負例との類似度を最小化しつつ、2つのビューの表現の一致度を最大化するように、対照的損失(例:InfoNCE)を適用する。
  • 20TBの4700万件のラベルなしシーンデータセットを用い、部分的センサー利用状態を模倣するためのチャネルドロップアウトによるデータ拡張を伴って訓練する。
  • 微調整なしで事前学習済みエンコーダーを下流タスクに直接転送し、遠隔測定分類におけるゼロショット性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしの例なしで、マルチセンサー遠隔測定データから対照的自己教師あり目的が有効に表現を学習できるか?
  • RQ2複数の低解像度センサーを統合することで、単一の高解像度センサーを用いるよりも優れた表現が得られるか?
  • RQ3学習された表現は、センサー固有のノイズや解像度の違いがあっても、センサーの組み合わせに一般化可能であり、意味的に明確なままであるか?
  • RQ4自己教師ありCSFモデルの性能は、遠隔測定ベンチマークにおいて教師ありImageNet事前学習と比較してどうなるか?

主な発見

  • CSFモデルは、100%ラベルなしデータで学習され、微調整なしに、ImageNet教師あり特徴量を上回る優れた性能を達成している。
  • より多くのセンサーチャネルを追加するにつれて表現の質が単調に向上し、補完的な情報を効果的に統合していることが示された。
  • SPOTとNAIPの統合は、Pléiades単体を上回る性能を示したが、Pléiadesはより高い空間解像度を有するにもかかわらず、これはスペクトル多様性とマルチビューの一貫性が解像度単体よりも重要であることを示している。
  • 12チャネルの完全統合CSFモデルは、すべてのk値においてクラスタリング評価で3バンドのImageNet特徴量を上回り、その頑健性と意味的豊かさを確認した。
  • 主成分分析の結果、畝、ブリッジ、裸地といった高レベルの概念が、異なるセンサー間で一貫して活性化されていることが判明し、センサーに依存しない分離可能特徴量学習が行われていることが示された。
  • 可視化結果から、同じ意味的コンセプト(例:コンクリートや植生)が、どのセンサーが入力であっても表現空間の同じ方向に捉えられていることが確認され、安定性と統合効果の両方が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。