[论文解读] GeoChat: Grounded Large Vision-Language Model for Remote Sensing
GeoChat 是首个专为遥感(RS)设计的、基于视觉语言模型(VLM)的接地型大模型,支持高分辨率 RS 图像的零样本多任务对话式人工智能。它支持图像级与区域级对话,通过空间坐标实现响应的视觉定位,并利用一个新颖的 318k 样本 RS 指令跟随数据集,实现了在图像字幕、视觉问题回答(VQA)、视觉定位和场景分类任务上的最先进零样本性能。
Recent advancements in Large Vision-Language Models (VLMs) have shown great promise in natural image domains, allowing users to hold a dialogue about given visual content. However, such general-domain VLMs perform poorly for Remote Sensing (RS) scenarios, leading to inaccurate or fabricated information when presented with RS domain-specific queries. Such a behavior emerges due to the unique challenges introduced by RS imagery. For example, to handle high-resolution RS imagery with diverse scale changes across categories and many small objects, region-level reasoning is necessary alongside holistic scene interpretation. Furthermore, the lack of domain-specific multimodal instruction following data as well as strong backbone models for RS make it hard for the models to align their behavior with user queries. To address these limitations, we propose GeoChat - the first versatile remote sensing VLM that offers multitask conversational capabilities with high-resolution RS images. Specifically, GeoChat can not only answer image-level queries but also accepts region inputs to hold region-specific dialogue. Furthermore, it can visually ground objects in its responses by referring to their spatial coordinates. To address the lack of domain-specific datasets, we generate a novel RS multimodal instruction-following dataset by extending image-text pairs from existing diverse RS datasets. We establish a comprehensive benchmark for RS multitask conversations and compare with a number of baseline methods. GeoChat demonstrates robust zero-shot performance on various RS tasks, e.g., image and region captioning, visual question answering, scene classification, visually grounded conversations and referring detection. Our code is available at https://github.com/mbzuai-oryx/geochat.
研究动机与目标
- 为解决通用领域 VLM 在遥感中表现不佳的问题,其原因包括尺度变化、小目标以及缺乏多模态指令数据。
- 开发一个统一的多任务对话式 AI 系统,能够处理图像级和区域级查询,并在遥感图像中实现空间定位。
- 构建一个大规模、多样化且面向遥感领域的多模态指令跟随数据集,以支持遥感 VLM 的有效指令微调。
- 建立一个全面的评估基准,用于评估遥感视觉语言模型,特别是在接地对话和视觉推理方面。
- 展示在多个遥感任务中强大的零样本泛化能力,包括 VQA、字幕生成、场景分类和指代表达检测。
提出的方法
- 通过使用 Vicuna-v1.5 的自动化数据生成方法,扩展现有 RS 数据集(如 LRBEN、NWPU-RESISC-45、SAMRS)中的图像-文本对,构建了一个新颖的 RS 多模态指令跟随数据集。
- 通过结合目标检测描述、场景分类提示和 VQA 风格问题,生成了 318,000 个多样化的指令-响应对。
- 使用 LoRA 对 LLaVA-1.5 进行微调,以在保留预训练知识的同时适应遥感领域,实现指令遵循和视觉定位功能。
- 在单一统一框架中引入特定任务的标记,以引导模型对不同任务(如字幕生成、VQA、定位)生成响应。
- 在输入中引入空间位置表征,以支持区域级推理,并输出视觉定位的边界框坐标。
- 建立了一个新的评估基准,包含用于定位、指代表达检测和区域级字幕生成的测试集,采用 IoU 和文本指标(ROUGE、METEOR)进行评估。

实验结果
研究问题
- RQ1一个单一的视觉语言模型是否能在一个统一的对话框架中有效处理多样化的遥感任务,如图像字幕、VQA 和视觉定位?
- RQ2在存在领域特定数据限制的情况下,一个经过零样本微调的 VLM 能在遥感特定任务中实现多任务泛化,其表现如何?
- RQ3大规模、合成的 RS 指令跟随数据集在多大程度上提升了下游 RS 视觉语言任务的零样本性能?
- RQ4VLM 是否能为高分辨率 RS 图像中物体的精确空间坐标生成视觉定位的响应?
- RQ5在多个 RS 基准测试中,GeoChat 与通用领域 VLM 及专用 RS 模型相比,其零样本准确率表现如何?
主要发现
- 在 RSVQA-HRBEN 数据集的零样本评估中,GeoChat 达到 72.30% 的平均准确率,优于 LLaVA-1.5 的 3.9% 和 MiniGPTv2 的 25.8%。
- 在 RSVQA-LRBEN 数据集上,GeoChat 在城乡分类子集上与 SOTA 专用模型 RSGPT 表现相当,展示了强大的零样本泛化能力。
- 在定位描述任务中,GeoChat 达到 11.7% 的 IoU@0.5 准确率和 83.9 的 METEOR 分数,显著优于 MiniGPTv2(10.8% 和 16.4 METEOR)。
- 在区域级字幕生成任务中,GeoChat 的 ROUGE-1 得分为 87.3,ROUGE-L 得分为 87.2,远超 MiniGPTv2 的 32.1 和 31.2。
- GeoChat 在指代表达检测和视觉定位任务中表现出色,相较于先前模型,其边界框准确率和描述连贯性均有提升。
- 所提出的基准和数据集实现了 RS VLM 的标准化评估,为未来在接地式、多任务 RS 视觉语言理解方面的研究奠定了基础。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。