Skip to main content
QUICK REVIEW

[论文解读] RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing

Zilun Zhang, Tiancheng Zhao|arXiv (Cornell University)|Jun 20, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出了RS5M,一个包含500万对遥感(RS)图像与文本的大型遥感图像-文本数据集,以及GeoRSCLIP,一个在RS5M上微调的领域特定视觉-语言模型。通过在CLIP上使用参数高效微调,GeoRSCLIP实现了最先进性能,在零样本分类任务中提升3%–20%,在检索任务中提升3%–6%,在语义定位任务中提升4%–5%。

ABSTRACT

Pre-trained Vision-Language Models (VLMs) utilizing extensive image-text paired data have demonstrated unprecedented image-text association capabilities, achieving remarkable results across various downstream tasks. A critical challenge is how to make use of existing large-scale pre-trained VLMs, which are trained on common objects, to perform the domain-specific transfer for accomplishing domain-related downstream tasks. A critical challenge is how to make use of existing large-scale pre-trained VLMs, which are trained on common objects, to perform the domain-specific transfer for accomplishing domain-related downstream tasks. In this paper, we propose a new framework that includes the Domain pre-trained Vision-Language Model (DVLM), bridging the gap between the General Vision-Language Model (GVLM) and domain-specific downstream tasks. Moreover, we present an image-text paired dataset in the field of remote sensing (RS), RS5M, which has 5 million RS images with English descriptions. The dataset is obtained from filtering publicly available image-text paired datasets and captioning label-only RS datasets with pre-trained VLM. These constitute the first large-scale RS image-text paired dataset. Additionally, we fine-tuned the CLIP model and tried several Parameter-Efficient Fine-Tuning methods on RS5M to implement the DVLM. Experimental results show that our proposed dataset is highly effective for various tasks, and our model GeoRSCLIP improves upon the baseline or previous state-of-the-art model by $3\%\sim20\%$ in Zero-shot Classification (ZSC), $3\%\sim6\%$ in Remote Sensing Cross-Modal Text-Image Retrieval (RSCTIR) and $4\%\sim5\%$ in Semantic Localization (SeLo) tasks. Dataset and models have been released in: \url{https://github.com/om-ai-lab/RS5M}.

研究动机与目标

  • 为解决当前缺乏大规模、高质量的遥感图像-文本配对数据集以训练领域特定视觉-语言模型的问题。
  • 弥合通用视觉-语言模型(GVLMs)与遥感应用之间的领域差距,其中领域特定知识至关重要。
  • 开发一种领域特定视觉-语言模型(DVLM),以有效将通用视觉-语言模型中的可迁移知识迁移至遥感特定下游任务。
  • 评估参数高效微调方法在大规模遥感数据上的有效性,以提升模型泛化能力。
  • 将RS5M和GeoRSCLIP作为开放资源发布,以加速遥感视觉-语言理解领域的研究。

提出的方法

  • 通过使用预训练视觉-语言模型对公开可用的图像-文本数据集进行过滤与增强,构建了RS5M,以确保高质量、与领域相关的图像-文本配对。
  • 利用现有的大规模数据集,如LAION2B、COYO700M、WIT和YFCC15M,应用严格过滤策略,仅保留带有描述性标题的遥感图像。
  • 采用参数高效微调(PEFT)技术(包括LoRA)对CLIP主干网络进行微调,以将通用视觉-语言模型适配至遥感领域。
  • 在三个下游任务上评估生成的GeoRSCLIP模型:零样本分类、跨模态检索和语义定位。
  • 通过在RS5M数据的1%上使用Dreambooth进行微调,生成了一个专用的Stable Diffusion模型(RS-SD),提升了遥感图像生成的保真度。
  • 进行了广泛的消融研究与安全检查,包括元数据许可验证和敏感地理位置数据的清除,以确保伦理与法律合规性。

实验结果

研究问题

  • RQ1大规模、高质量的图像-文本数据集是否能显著提升视觉-语言模型在遥感应用中的性能?
  • RQ2参数高效微调在将通用视觉-语言模型适配至遥感领域方面的有效性如何?
  • RQ3与通用模型相比,基于RS5M进行领域特定预训练在零样本分类、检索和定位任务中的性能提升程度如何?
  • RQ4在RS5M上微调的视觉-语言模型是否能生成比原始扩散模型更真实、语义对齐的遥感图像?
  • RQ5构建大规模遥感图像-文本数据集面临的主要挑战与风险是什么?如何有效缓解?

主要发现

  • GeoRSCLIP在遥感基准测试中,相较于基线CLIP模型,零样本分类准确率提升了3%至20%。
  • 在遥感跨模态文本-图像检索(RSCTIR)任务中,检索性能提升了3%至6%。
  • 与基线模型及先前最先进模型相比,语义定位(SeLo)性能提升了4%至5%。
  • 在RS5M的1%数据上微调的Stable Diffusion模型(RS-SD)取得了28.32的Fréchet Inception Distance(FID)分数,显著优于原始Stable Diffusion的36.86,表明图像生成质量更优。
  • 异常值分析显示,仅0.8%的RS5M图像被错误分类为非遥感图像,且3.4%的被移除图像为误过滤,表明数据质量高且过滤机制稳健。
  • 数据集与模型以非商业学术使用许可发布,完整元数据与图像-文本对可通过GitHub和云存储获取,供研究使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。