Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Audiovisual Representation Learning for Remote Sensing Data

Konrad Heidler, Lichao Mou|arXiv (Cornell University)|Aug 2, 2021
Remote-Sensing Image Classification参考文献 55被引用数 6
ひとこと要約

本論文は、地理的座標情報が付与された航空写真と対応する現地音声記録をペアで持つ、新規の大規模データセットSoundingEarthを用いて、リモートセンシング分野における自己教師付き音声視覚表現学習フレームワークを提案する。バッチ単位の三重損失を用いてResNetモデルを訓練し、視覚的・聴覚的埋め込みを共通の空間に一致させることで、複数のリモートセンシングベンチマークで最先端の転移学習性能を達成し、ImageNetや単一モodalの事前学習ベースラインを上回る。

ABSTRACT

Many current deep learning approaches make extensive use of backbone networks pre-trained on large datasets like ImageNet, which are then fine-tuned to perform a certain task. In remote sensing, the lack of comparable large annotated datasets and the wide diversity of sensing platforms impedes similar developments. In order to contribute towards the availability of pre-trained backbone networks in remote sensing, we devise a self-supervised approach for pre-training deep neural networks. By exploiting the correspondence between geo-tagged audio recordings and remote sensing imagery, this is done in a completely label-free manner, eliminating the need for laborious manual annotation. For this purpose, we introduce the SoundingEarth dataset, which consists of co-located aerial imagery and audio samples all around the world. Using this dataset, we then pre-train ResNet models to map samples from both modalities into a common embedding space, which encourages the models to understand key properties of a scene that influence both visual and auditory appearance. To validate the usefulness of the proposed approach, we evaluate the transfer learning performance of pre-trained weights obtained against weights obtained through other means. By fine-tuning the models on a number of commonly used remote sensing datasets, we show that our approach outperforms existing pre-training strategies for remote sensing imagery. The dataset, code and pre-trained model weights will be available at https://github.com/khdlr/SoundingEarth.

研究の動機と目的

  • リモートセンシング分野において、アノテーション付きデータセットの不足に起因する、大規模かつマルチモーダルで自己教師付きの事前学習データの欠如を解決すること。
  • 空中写真と現地記録音声の自然な対応関係を活用して、ラベルなしの事前学習アプローチを開発し、強固で汎用性の高い表現を学習すること。
  • リモートセンシングにおけるマルチモーダル表現学習を支援する、大規模で位置が一致する音声視覚データセット(SoundingEarth)を構築すること。
  • 分類、セグメンテーション、クロスモーダルリtrievalなどの下流リモートセンシングタスクにおける音声視覚自己教師付き事前学習の有効性を評価すること。
  • 共同音声視覚事前学習が、単一モーダルまたはImageNet事前学習よりも優れた転移性能を示すことを実証すること。

提案手法

  • 著者らは、公共の音声アーカイブであるRadio Aporeeから収集された、50,000組以上の位置が一致する航空写真と現地音声記録のペアを含むSoundingEarthデータセットを導入する。
  • バッチ単位の三重損失を用いて、視覚的・聴覚的埋め込みを共通の空間に一致させる自己教師付きの方法で深層ニューラルネットワーク(ResNet)を訓練する。この損失関数は、正例ペアが負例ペアよりも埋め込み空間内で近くなるように促進する。
  • 古典的な三重損失の利点と対照学習の利点を組み合わせ、バッチ内でのハードネガティブ例とグローバルな対照的監視を最適化する。
  • 音声特徴はログメルスペクトログラムとして抽出され、画像特徴はResNetバックボーンを介して抽出され、両モーダルの埋め込みは共通のd次元空間に射影される。
  • このフレームワークにより、空撮画像分類、セグメンテーション、クロスモーダルリtrievalなどの下流タスクへのゼロショットまたはファインチューニング転移が可能になる。
  • 自動指標(例:トップ100リtrieval正答率)と人間評価(チューリングテスト)の両方を用いて、意味的アライメントの質を検証する。
Figure 1: Two examples of corresponding imagery and audio. From top to bottom: Aerial image, waveform, log-mel spectrogram. For visualization purposes, the audio data was clipped to the first 20 seconds, even though the full samples are much longer. They can be found at archive.org/details/aporee_46
Figure 1: Two examples of corresponding imagery and audio. From top to bottom: Aerial image, waveform, log-mel spectrogram. For visualization purposes, the audio data was clipped to the first 20 seconds, even though the full samples are much longer. They can be found at archive.org/details/aporee_46

実験結果

リサーチクエスチョン

  • RQ1リモートセンシングデータにおける音声視覚の対応関係を用いた自己教師付き学習は、手動アノテーションなしで表現品質を向上させることができるか?
  • RQ2音声視覚の共同事前学習は、単一モーダルまたはImageNet事前学習と比較して、下流リモートセンシングタスクにおける転移性能を向上させるか?
  • RQ3提案されたバッチ単位の三重損失は、標準的な対照学習や三重損失と比較して、効果的なマルチモーダル表現を学習する上でどのように優れているか?
  • RQ4学習された表現が、視覚的シーンとその対応音響環境の間で意味的に意味のあるアライメントをどの程度捉えているか?
  • RQ5人間評価者が、実際の画像音声ペアとモデルが予測したペアを区別できるか。これは、学習された表現の質を示唆する。

主な発見

  • 提案された自己教師付き音声視覚事前学習手法は、評価されたすべての下流タスクで、ImageNet事前学習および単一モーダル事前学習を上回る性能を示した。
  • 空撮画像分類ベンチマークでは、モデルがEuroSATデータセットでファインチューニングされた際、トップ1正答率が89.4%に達し、ImageNetおよび単一モーダルベースラインを上回った。
  • クロスモーダルリtrievalでは、ResNet-18モデルがテストサンプルの19.01%で正しい音声サンプルをトップ100内に検索し、中央順位(median rank)は744であった。これは強い意味的アライメントを示している。
  • 人間によるチューリングテストでは、参加者が実際の画像音声ペアを71.6%の確率で正しく識別でき、モデルが予測したペアについても同様に69.5%の正確さを示した。これは、学習された表現の質が妥当であることを裏付けた。
  • アブレーションスタディの結果、提案されたバッチ単位の三重損失は、ほとんどのタスクで標準的な三重損失および対照損失を上回ったが、リtrievalタスクでは対照損失が優れていた。これは、対照損失のハイパーサイリカルな埋め込み制約が、リtrievalタスクに適していることを示唆した。
  • 結果から、音声視覚の対応関係が、リモートセンシングにおける自己教師付き事前学習の強力な監視信号を提供することが明らかになった。これにより、多様なタスクとモーダルにわたる汎用性が実現された。
Figure 2: Spatial distribution of samples in our SoundingEarth dataset.
Figure 2: Spatial distribution of samples in our SoundingEarth dataset.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。