[论文解读] Learning to Interpret Satellite Images Using Wikipedia
本文提出利用地理标记的维基百科文章作为弱监督标签,对深度学习模型进行卫星图像理解的预训练,显著减少了对昂贵人工标注数据的需求。通过将240万篇维基百科文章与对应的卫星图像配对(尤其聚焦于非洲地区),研究表明,基于这一大规模、多模态数据集进行预训练,相较于从零开始训练,可使下游分类准确率提升超过6%,即使在标注数据极少的情况下亦是如此。
Despite recent progress in computer vision, fine-grained interpretation of satellite images remains challenging because of a lack of labeled training data. To overcome this limitation, we propose using Wikipedia as a previously untapped source of rich, georeferenced textual information with global coverage. We construct a novel large-scale, multi-modal dataset by pairing geo-referenced Wikipedia articles with satellite imagery of their corresponding locations. To prove the efficacy of this dataset, we focus on the African continent and train a deep network to classify images based on labels extracted from articles. We then fine-tune the model on a human annotated dataset and demonstrate that this weak form of supervision can drastically reduce the quantity of human annotated labels and time required for downstream tasks.
研究动机与目标
- 为解决细粒度卫星图像理解任务中训练数据稀缺的问题,特别是在非洲等数据匮乏地区。
- 探索将维基百科作为丰富、地理标记且全球分布的文本注释来源,用于卫星图像标注的可行性。
- 评估来自维基百科的弱监督是否能有效预训练深度神经网络,以用于卫星图像领域的下游计算机视觉任务。
- 证明基于维基百科标签的卫星图像进行预训练,可显著减少高性能分类任务中所需的人工标注数据量。
提出的方法
- 通过位置坐标自动将地理标记的维基百科文章与对应的卫星图像配对,构建大规模多模态数据集。
- 从维基百科文章中提取经过筛选的摘要标签,作为图像分类任务的弱标签。
- 在维基百科标注的卫星图像上训练ResNet50卷积神经网络,以学习视觉-语义表示。
- 在人工标注的卫星图像数据集(fMoW)上微调预训练模型,以评估迁移性能。
- 通过在fMoW数据集上测试预训练模型而无需任何微调,评估零样本迁移性能。
- 在不同数量的人工标注数据(如64、11000、22000个样本)下比较模型性能,以评估数据效率的提升。
实验结果
研究问题
- RQ1维基百科文章能否作为可扩展且有效的弱监督来源,用于训练模型以理解卫星图像?
- RQ2与从零开始训练相比,基于维基百科标注的卫星图像进行预训练,在下游分类准确率方面能提升多少?
- RQ3在卫星图像理解任务中,使用基于维基百科的预训练,可将人工标注数据量减少多少?
- RQ4当在未见过的地理区域(如全球fMoW数据集)上测试时,基于非洲维基百科数据预训练的模型性能是否受益?
主要发现
- 在22,000个样本上进行微调时,基于维基百科-卫星图像数据集进行预训练的模型在fMoW基准测试中,top-1准确率相比从零开始训练提升了超过6%。
- 仅使用64个人工标注样本,该维基百科预训练模型在三分类任务中达到了82.03%的准确率,优于在1,200个样本上训练的基线模型。
- 在未进行任何微调的情况下,该模型在fMoW数据集上对六种类别(机场、桥梁、水坝、体育场、湖泊、港口)实现了53.4%的零样本准确率,表明弱监督带来了强大的泛化能力。
- 当下游任务类别在维基百科预训练数据中已有良好覆盖时,维基百科预训练带来的性能增益最为显著,凸显了类别重叠的重要性。
- 在fMoW的19个类别中,使用22,000个样本时,基于维基百科数据预训练的模型达到55.07%的准确率,而从零开始训练的基线模型仅为49.97%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。