Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Audiovisual Representation Learning for Remote Sensing Data

Konrad Heidler, Lichao Mou|arXiv (Cornell University)|2021. 08. 02.
Remote-Sensing Image Classification참고 문헌 55인용 수 6
한 줄 요약

이 논문은 지리적 태그가 부여된 항공 영상과 해당 현장 음성 기록을 짝지은 새로운 대규모 데이터셋인 SoundingEarth를 사용하여 원격 감지 분야에서 자기지도 학습 기반의 시각-청각 표현 학습 프레임워크를 제안한다. 배치 기반의 삼중체 손실을 통해 ResNet 모델을 훈련시켜 시각적 및 청각적 임베딩을 공통된 공간에 정렬함으로써, 다양한 원격 감지 벤치마크에서 이미지넷 및 단일 모odal 전훈련 기반의 최신 기술을 초월하는 전이 학습 성능을 달성한다.

ABSTRACT

Many current deep learning approaches make extensive use of backbone networks pre-trained on large datasets like ImageNet, which are then fine-tuned to perform a certain task. In remote sensing, the lack of comparable large annotated datasets and the wide diversity of sensing platforms impedes similar developments. In order to contribute towards the availability of pre-trained backbone networks in remote sensing, we devise a self-supervised approach for pre-training deep neural networks. By exploiting the correspondence between geo-tagged audio recordings and remote sensing imagery, this is done in a completely label-free manner, eliminating the need for laborious manual annotation. For this purpose, we introduce the SoundingEarth dataset, which consists of co-located aerial imagery and audio samples all around the world. Using this dataset, we then pre-train ResNet models to map samples from both modalities into a common embedding space, which encourages the models to understand key properties of a scene that influence both visual and auditory appearance. To validate the usefulness of the proposed approach, we evaluate the transfer learning performance of pre-trained weights obtained against weights obtained through other means. By fine-tuning the models on a number of commonly used remote sensing datasets, we show that our approach outperforms existing pre-training strategies for remote sensing imagery. The dataset, code and pre-trained model weights will be available at https://github.com/khdlr/SoundingEarth.

연구 동기 및 목표

  • 원격 감지 분야에서 애너테이션된 데이터셋의 부족으로 인해 대규모, 다중 모달, 자기지도 학습 기반의 전훈련 데이터의 부족 문제를 해결하기 위해.
  • 항공 영상과 현장에서 기록된 음성 간의 자연스러운 대응 관계를 활용하여 레이블이 없는 전훈련 방법을 개발하여 강건하고 일반화 가능한 표현을 학습하기 위해.
  • 다양한 원격 감지 분야의 다중 모달 표현 학습을 지원하기 위해 대규모로 공동 위치한 시각-청각 데이터셋(SoundingEarth)을 구축하기 위해.
  • 분류, 세분화, 다중 모달 검색과 같은 원격 감지 작업에 대한 자기지도 학습 기반 전훈련의 효과성을 평가하기 위해.
  • 단일 모달 또는 이미지넷 전훈련보다 시각-청각 공동 전훈련이 더 높은 전이 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • 저자들은 Radio Aporee라는 공공 음성 아카이브에서 수집한 50,000개 이상의 공통 위치에 있는 항공 영상과 현장 음성 기록 쌍으로 구성된 SoundingEarth 데이터셋을 소개한다.
  • 이중 모달 임베딩을 공통된 공간에 정렬하기 위해, 양호한 이미지-음성 쌍이 부정적인 쌍보다 임베딩 공간에서 더 가까워지도록 유도하는 새로운 배치 기반 삼중체 손실을 사용하여 ResNet 기반의 딥 네트워크를 자기지도 학습 방식으로 훈련시킨다.
  • 손실 함수는 전통적인 삼중체 손실의 이점을 바탕으로 대비 학습과 융합하여, 배치 내 하드 부정 예측과 전역 대비 감독을 동시에 최적화한다.
  • 음성 특징은 로그-멜 스펙트로그램으로 추출되며, 이미지 특징은 ResNet 기반의 백본을 통해 추출되며, 두 모달의 임베딩은 모두 공통의 d차원 공간으로 투영된다.
  • 이 프레임워크는 항공 영상 분류, 세분화, 다중 모달 검색 등의 하류 작업에 대해 제로샷 또는 미세조정된 전이를 가능하게 한다.
  • 자동 평가 지표(예: 상위 100개 검색 정확도)와 인간 평가(Turing 테스트)를 모두 활용하여 의미적 정렬의 품질을 검증한다.
Figure 1: Two examples of corresponding imagery and audio. From top to bottom: Aerial image, waveform, log-mel spectrogram. For visualization purposes, the audio data was clipped to the first 20 seconds, even though the full samples are much longer. They can be found at archive.org/details/aporee_46
Figure 1: Two examples of corresponding imagery and audio. From top to bottom: Aerial image, waveform, log-mel spectrogram. For visualization purposes, the audio data was clipped to the first 20 seconds, even though the full samples are much longer. They can be found at archive.org/details/aporee_46

실험 결과

연구 질문

  • RQ1원격 감지 데이터에서 시각-청각 대응 관계를 활용한 자기지도 학습이 수동 애너테이션 없이 표현 품질을 향상시킬 수 있는가?
  • RQ2단일 모달 또는 이미지넷 전훈련에 비해 시각-청각 공동 전훈련이 하류 원격 감지 작업에서 더 높은 전이 성능를 낼 수 있는가?
  • RQ3제안된 배치 기반 삼중체 손실이 효과적인 다중 모달 표현을 학습하는 데 있어 표준 대비 학습 및 삼중체 손실과 비교해 어떻게 성능을 내는가?
  • RQ4학습된 표현이 시각적 장면과 해당 음향 환경 간에 의미적으로 유의미한 정렬을 얼마나 잘 포착하는가?
  • RQ5인간 평가자들이 실제와 모델 예측된 이미지-음성 쌍을 구분할 수 있는가, 이는 학습된 표현의 품질을 입증하는가?

주요 결과

  • 제안된 자기지도 학습 기반의 시각-청각 전훈련 방법은 원격 감지 분야의 모든 평가된 하류 작업에서 이미지넷 전훈련 및 단일 모달 전훈련 기반의 방법을 모두 능가한다.
  • 항공 영상 분류 벤치마크에서, 모델는 EuroSAT 데이터셋에 대해 미세조정한 결과 상위 1위 정확도가 89.4%에 도달하여 이미지넷 및 단일 모달 기반의 베이스라인을 초월한다.
  • 다중 모달 검색 작업에서 ResNet-18 모델은 테스트 샘플의 19.01%에서 정확한 음성 샘플을 상위 100위 내로 검색했으며, 중앙 순위는 744로 의미적 정렬이 우수함을 시사한다.
  • 인간 Turing 테스트에서 참가자들은 실제 이미지-음성 쌍을 71.6%의 정확도로, 모델 예측 쌍을 69.5%의 정확도로 구분했으며, 이는 학습된 표현의 품질을 검증한다.
  • 절단 분석 결과, 제안된 배치 기반 삼중체 손실은 대부분의 작업에서 표준 삼중체 손실 및 대비 학습 손실보다 우수한 성능를 보였지만, 검색 작업에서는 대비 학습 손실이 훨씬 더 높은 성능를 보였는데, 이는 히퍼구형 임베딩 제약 조건 덕분이었다.
  • 결과적으로 시각-청각 대응 관계는 자기지도 학습 기반 전훈련에 강력한 감독 신호를 제공하며, 다양한 작업과 모달 간의 일반화를 가능하게 한다.
Figure 2: Spatial distribution of samples in our SoundingEarth dataset.
Figure 2: Spatial distribution of samples in our SoundingEarth dataset.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.