Skip to main content
QUICK REVIEW

[论文解读] Representation Learning for Remote Sensing: An Unsupervised Sensor Fusion Approach

Aidan Swope, Xander Rudelis|arXiv (Cornell University)|Aug 11, 2021
Remote-Sensing Image Classification被引用 8
一句话总结

本文提出对比传感器融合(CSF),一种自监督方法,通过随机通道/传感器丢弃形成的视图对比,训练单一深度编码器,从任意组合的多传感器遥感数据中学习语义上有意义的表征。在4700万个未标注的同区图像三元组上进行训练,CSF表征在遥感分类任务中优于ImageNet监督特征,且随着传感器输入的增加性能持续提升,即使在融合后也优于单个高分辨率传感器的性能。

ABSTRACT

In the application of machine learning to remote sensing, labeled data is often scarce or expensive, which impedes the training of powerful models like deep convolutional neural networks. Although unlabeled data is abundant, recent self-supervised learning approaches are ill-suited to the remote sensing domain. In addition, most remote sensing applications currently use only a small subset of the multi-sensor, multi-channel information available, motivating the need for fused multi-sensor representations. We propose a new self-supervised training objective, Contrastive Sensor Fusion, which exploits coterminous data from multiple sources to learn useful representations of every possible combination of those sources. This method uses information common across multiple sensors and bands by training a single model to produce a representation that remains similar when any subset of its input channels is used. Using a dataset of 47 million unlabeled coterminous image triplets, we train an encoder to produce semantically meaningful representations from any possible combination of channels from the input sensors. These representations outperform fully supervised ImageNet weights on a remote sensing classification task and improve as more sensors are fused. Our code is available at https://storage.cloud.google.com/public-published-datasets/csf_code.zip.

研究动机与目标

  • 解决遥感中标签数据稀缺的问题,其中像素级标注成本高且耗时。
  • 克服现有自监督方法在遥感中适用性差的局限,因遥感数据具有高空间变异性及复杂场景布局。
  • 通过学习统一表征,实现多传感器、多通道数据的有效融合,该表征可泛化于所有可能的传感器组合。
  • 开发一种方法,学习解耦的、传感器无关的特征,适用于下游任务且无需微调。

提出的方法

  • 使用对比损失训练单一编码器,鼓励同一场景的两个视图(通过从不同传感器随机丢弃输入通道形成)产生相似的表征。
  • 使用来自三个光学传感器(SPOT、NAIP、Pléiades)的同区图像三元组,每个传感器具有四个波段,共12个输入通道。
  • 通过从可用传感器中随机选择通道子集形成每个场景的两个视图,确保两个视图共享相同的底层场景上下文。
  • 应用对比损失(如InfoNCE),以最大化两个视图表征的一致性,同时最小化与负样本的相似性。
  • 在包含4700万个未标注场景的20TB数据集上进行训练,通过通道丢弃实现数据增强,以模拟部分传感器不可用的情况。
  • 直接将预训练编码器迁移至下游任务,无需微调,评估其在遥感分类任务中的零样本性能。

实验结果

研究问题

  • RQ1无标注样本的情况下,自监督对比目标能否有效学习多传感器遥感数据的表征?
  • RQ2融合多个低分辨率传感器是否能获得优于单个高分辨率传感器的表征?
  • RQ3所学表征能否在不同传感器组合间泛化,并在存在传感器特异性噪声和分辨率差异的情况下保持语义意义?
  • RQ4无监督的CSF模型在遥感基准测试中与ImageNet预训练的监督方法相比表现如何?

主要发现

  • 尽管在100%未标注数据上训练且无需任何微调,CSF模型在遥感分类任务中的表现优于ImageNet监督特征。
  • 随着更多传感器通道的加入,表征质量单调提升,证明了互补信息的有效融合。
  • 融合SPOT与NAIP数据的性能优于单独使用Pléiades,尽管Pléiades具有更高的空间分辨率,表明光谱多样性与多视图一致性比分辨率本身更为关键。
  • 12通道完全融合的CSF模型在所有k值的聚类评估中均优于3波段ImageNet特征,证实其鲁棒性与语义丰富性。
  • 主成分分析显示,高级概念(如农田、桥梁、裸土)在不同传感器中均被一致激活,表明实现了传感器无关的、解耦的特征学习。
  • 可视化结果表明,无论输入来自哪个传感器,同一语义概念(如混凝土或植被)在表征空间中均被捕捉在相同方向,证实了表征的稳定性与融合有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。