[论文解读] SATIN: A Multi-Task Metadataset for Classifying Satellite Imagery using Vision-Language Models
SATIN 是一个跨 6 种分类任务的多任务元数据集,整合了来自 27 个遥感数据集的全球多样化、高分辨率卫星图像,支持视觉-语言模型在该领域的零样本评估。该基准测试揭示了显著挑战,最强模型仅达到 52.0% 的准确率,凸显了对更鲁棒的遥感理解方法的迫切需求。
Interpreting remote sensing imagery enables numerous downstream applications ranging from land-use planning to deforestation monitoring. Robustly classifying this data is challenging due to the Earth's geographic diversity. While many distinct satellite and aerial image classification datasets exist, there is yet to be a benchmark curated that suitably covers this diversity. In this work, we introduce SATellite ImageNet (SATIN), a metadataset curated from 27 existing remotely sensed datasets, and comprehensively evaluate the zero-shot transfer classification capabilities of a broad range of vision-language (VL) models on SATIN. We find SATIN to be a challenging benchmark-the strongest method we evaluate achieves a classification accuracy of 52.0%. We provide a $\href{https://satinbenchmark.github.io}{ ext{public leaderboard}}$ to guide and track the progress of VL models in this important domain.
研究动机与目标
- 解决当前缺乏全面、多样化基准来评估视觉-语言模型在遥感图像上性能的问题。
- 克服现有卫星数据集中存在的数据异质性挑战,包括分辨率差异、地理覆盖范围不同以及标签层级结构不一致等问题。
- 利用现代机器学习平台创建一个统一且可访问的基准,以简化评估流程,降低遥感模型开发中的摩擦。
- 评估多种视觉-语言模型在多样化卫星图像分类任务中的零样本迁移能力。
- 建立公开排行榜,以追踪并激励基于视觉-语言模型的零样本卫星图像分类研究进展。
提出的方法
- 从 27 个现有的遥感数据集中精选 SATIN,涵盖六类不同的分类任务:土地覆盖、土地利用、分层土地利用、复杂场景、稀有场景和假彩色图像。
- 对所有数据集统一元数据,包括分辨率、地理覆盖范围和类别标签,以确保评估的一致性。
- 利用 Hugging Face 数据集和 Transformers API,实现在所有数据集上无缝、可复现且低摩擦的模型评估。
- 采用自然语言提示(例如:"{CLS} 的卫星照片")进行零样本推理,以在不微调的情况下评估视觉-语言模型。
- 在所有任务中使用一致的提示模板,以确保零样本迁移性能评估的公平性与可比性。
- 测量不同模型和数据集之间的推理效率与 GPU 显存使用情况,以评估计算可行性。
实验结果
研究问题
- RQ1在分辨率和标签层级结构各异、全球分布的多样化卫星图像上,视觉-语言模型在零样本设置下的泛化能力如何?
- RQ2当前视觉-语言模型在统一的、多任务的卫星图像分类基准上的性能上限是什么?
- RQ3模型容量与架构如何影响 SATIN 基准上零样本准确率与推理效率?
- RQ4与标准的土地覆盖或土地利用任务相比,稀有、复杂或假彩色场景的引入在多大程度上挑战了视觉-语言模型?
- RQ5像 SATIN 这样标准化且公开可用的基准,能否有效引导并加速遥感视觉-语言理解领域的进展?
主要发现
- 在 SATIN 上评估的最强视觉-语言模型实现了 52.0% 的零样本分类准确率,表明在零样本遥感理解方面仍有巨大提升空间。
- 即使是高容量模型如 OpenCLIP 和 BLIP2,在复杂场景和稀有类别上也表现吃力,表明其在多样化卫星数据分布上的泛化能力存在局限。
- 不同模型的推理时间差异显著,大型架构如 BLIP2 和 OpenCLIP 完成 SATIN 全部评估需超过 100 分钟,凸显其计算成本高昂。
- 小型模型如 SLIP 和 DeCLIP 在显著更低的推理时间和 GPU 显存使用下实现了具有竞争力的准确率,表明其在效率权衡上更具优势。
- SATIN 基准揭示了各类任务间存在显著的性能差距,其中假彩色图像和稀有场景分类尤为具挑战性。
- 公开排行榜与标准化评估流程已推动社区参与,并实现了遥感视觉-语言模型开发中的可复现进展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。