[论文解读] SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
本文提出了FIT-RS,一个大规模(180万样本)的细粒度指令微调数据集,用于遥感视觉-语言理解,涵盖复杂理解任务如关系推理和场景图生成。基于FIT-RS,作者开发了SkySenseGPT,一种遥感视觉-语言大模型(LMM),在公开基准测试以及新的FIT-RSFG和FIT-RSRC基准测试中均优于现有模型,显著提升了细粒度空间关系理解能力。
Remote Sensing Large Multi-Modal Models (RSLMMs) are developing rapidly and showcase significant capabilities in remote sensing imagery (RSI) comprehension. However, due to the limitations of existing datasets, RSLMMs have shortcomings in understanding the rich semantic relations among objects in complex remote sensing scenes. To unlock RSLMMs' complex comprehension ability, we propose a large-scale instruction tuning dataset FIT-RS, containing 1,800,851 instruction samples. FIT-RS covers common interpretation tasks and innovatively introduces several complex comprehension tasks of escalating difficulty, ranging from relation reasoning to image-level scene graph generation. Based on FIT-RS, we build the FIT-RSFG benchmark. Furthermore, we establish a new benchmark to evaluate the fine-grained relation comprehension capabilities of LMMs, named FIT-RSRC. Based on combined instruction data, we propose SkySenseGPT, which achieves outstanding performance on both public datasets and FIT-RSFG, surpassing existing RSLMMs. We hope the FIT-RS dataset can enhance the relation comprehension capability of RSLMMs and provide a large-scale fine-grained data source for the remote sensing community. The dataset will be available at https://github.com/Luo-Z13/SkySenseGPT
研究动机与目标
- 为解决现有遥感视觉-语言大模型(LMM)在细粒度空间关系理解方面因指令微调数据有限且过于简单而导致的不足。
- 开发一个全面的基准测试,用于评估遥感领域中的细粒度关系理解,以弥补标准化评估协议的缺失。
- 创建一个大规模、高质量的指令微调数据集(FIT-RS),涵盖基础任务和新颖的复杂推理任务,包括图像级与区域级的场景图生成。
- 训练SkySenseGPT,一种先进的遥感视觉-语言大模型(RSLMM),在通用和细粒度遥感理解任务中均表现出色。
- 向研究社区提供一个公开可用、可扩展的资源,以推动遥感领域中细粒度视觉-语言理解的发展。
提出的方法
- 作者构建了FIT-RS,一个基于遥感图像的180万条样本指令微调数据集,通过专家与大语言模型(LLM)增强的标注,实现对细粒度空间关系的精准刻画。
- 该数据集包含多样化任务,如图像字幕生成、视觉问答(VQA)、目标检测、多标签场景分类,以及新颖的复杂任务,如区域级与图像级的关系推理和场景图生成。
- 建立了FIT-RSFG基准测试,用于评估模型在FIT-RS中全部任务(包括细粒度理解)上的性能表现。
- 引入了FIT-RSRC基准测试,作为首个专门用于遥感关系理解的评估套件,采用CircularEval策略,并使用专家筛选的、基于常识的干扰项选项。
- SkySenseGPT通过整合来自FIT-RS的联合指令数据进行训练,充分发挥模型在复杂空间推理任务上的泛化能力。
- 数据集与模型通过GitHub发布,以确保社区可访问性与可复现性。
实验结果
研究问题
- RQ1大规模、细粒度的指令微调数据集在多大程度上能提升遥感视觉-语言大模型(LMM)的空间关系理解能力?
- RQ2现有遥感视觉-语言大模型(RSLMM)在多大程度上能泛化到如图像级场景图生成等复杂遥感理解任务?
- RQ3新提出的基准测试(FIT-RSRC)能否有效且公平地评估LMM在遥感领域中的细粒度关系理解能力?
- RQ4SkySenseGPT在公开基准测试以及新提出的FIT-RSFG和FIT-RSRC基准测试中,与现有RSLMM相比表现如何?
- RQ5在模型中引入专家筛选与GPT-4增强的常识性关系-对象词列表,对模型鲁棒性与评估公平性有何影响?
主要发现
- SkySenseGPT在公开遥感基准测试中达到最先进性能,展现出卓越的泛化与理解能力。
- 该模型在新提出的FIT-RSFG基准测试中显著优于现有RSLMM,该基准测试全面评估了在多样化复杂任务中的细粒度理解能力。
- FIT-RSRC作为首个专门用于遥感关系理解的基准测试,表明SkySenseGPT能以高精度泛化到未见过的空间推理模式。
- FIT-RSRC中采用专家筛选与GPT-4增强的干扰项选项,提升了评估的公平性,有效防止了仅依赖文本的猜测策略。
- FIT-RS数据集包含1,800,851条高质量指令样本,图像字幕平均长度为619.21个token,表明其具有高度细节与语义丰富性。
- 该数据集包含新颖的、复杂度逐步提升的任务,如区域级与图像级场景图生成,使模型能够学习分层的空间关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。