Skip to main content
QUICK REVIEW

[论文解读] Learning to Interpret Satellite Images in Global Scale Using Wikipedia

Burak Uzkent, Evan Sheehan|arXiv (Cornell University)|May 7, 2019
Multimodal Machine Learning Applications参考文献 30被引用 17
一句话总结

本文提出 WikiSatNet,一个大规模多模态数据集,将地理定位的维基百科文章与对应的卫星图像配对,以实现卷积神经网络在卫星图像理解任务上的自监督预训练。通过利用维基百科文本作为弱监督信号——无论是通过筛选标签还是图文对比学习——该方法在 fMoW 基准测试中相较 ImageNet 预训练实现了 4.5% 的绝对 F1 分数提升,显著减少了对昂贵人工标注标签的依赖。

ABSTRACT

Despite recent progress in computer vision, finegrained interpretation of satellite images remains challenging because of a lack of labeled training data. To overcome this limitation, we construct a novel dataset called WikiSatNet by pairing georeferenced Wikipedia articles with satellite imagery of their corresponding locations. We then propose two strategies to learn representations of satellite images by predicting properties of the corresponding articles from the images. Leveraging this new multi-modal dataset, we can drastically reduce the quantity of human-annotated labels and time required for downstream tasks. On the recently released fMoW dataset, our pre-training strategies can boost the performance of a model pre-trained on ImageNet by up to 4:5% in F1 score.

研究动机与目标

  • 通过利用地理定位维基百科文章中丰富的众包文本注释,解决卫星图像标注数据稀缺的问题。
  • 开发自监督预训练策略,将维基百科文本知识迁移至卫星图像表征中。
  • 在下游卫星图像识别任务中,减少对昂贵人工标注数据集的依赖。
  • 通过 fMoW 和 SpaceNet 等真实世界基准,评估多模态预训练在全球规模卫星图像上的有效性。

提出的方法

  • 通过位置坐标将 888,696 个地理定位的维基百科文章与对应卫星图像配对,构建 WikiSatNet 数据集。
  • 通过自动摘要和标签提取从维基百科文章中提取弱标签,用于监督图像分类。
  • 训练卷积神经网络直接从卫星图像预测这些弱标签,学习可泛化的视觉表征。
  • 开发一种联合图文对比学习框架,利用基于自然语言处理的文档摘要技术对齐图像与文本嵌入。
  • 将 WikiSatNet 预训练的图像编码器用作下游任务(如土地覆盖分类和语义分割)的特征提取器。
  • 在小规模标注数据集(如 fMoW、SpaceNet)上微调预训练模型,以评估迁移性能。

实验结果

研究问题

  • RQ1维基百科中丰富的地理定位文本内容能否作为预训练卫星图像分类器的可扩展弱监督来源?
  • RQ2在卫星图像识别的下游任务中,WikiSatNet 预训练相较于 ImageNet 预训练的性能表现如何?
  • RQ3在无显式弱标签的情况下,图文对比学习是否优于使用筛选标签的弱监督学习?
  • RQ4WikiSatNet 预训练在多大程度上减少了卫星图像任务中对人工标注数据的需求?
  • RQ5WikiSatNet 预训练在不同下游任务(如图像分类和语义分割)中是否具备良好的泛化能力?

主要发现

  • 与 ImageNet 预训练相比,WikiSatNet 预训练在 fMoW 数据集上将 F1 分数提升了 4.5%,且在数据量较低的场景下提升最为显著。
  • 在土地覆盖分类任务中,WikiSatNet 预训练达到 47.65% 的 top-1 准确率,优于 ImageNet(40.11%)和 CIFAR10(42.01%)预训练。
  • 在 SpaceNet Rio 数据集的语义分割任务中,WikiSatNet 预训练仅使用 200 个标注样本即达到 51.70% 的 IoU,超过 ImageNet 预训练(42.11%)在相同数据规模下的表现。
  • 当标注数据稀缺时,WikiSatNet 预训练的性能增益最为显著,表明其具备强大的 few-shot 泛化能力。
  • 无弱标签的图文匹配方法优于弱监督方法,表明联合表征学习比粗粒度标签预测更有效。
  • 结果表明,WikiSatNet 能够在有限人工标注数据下,实现对多样化卫星图像任务(包括分类与分割)的稳健迁移学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。