Skip to main content
QUICK REVIEW

[论文解读] VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis

Chao Pang, Xingxing Weng|arXiv (Cornell University)|Mar 29, 2024
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

本文提出 H2RSVLM,一种多功能且诚实的遥感视觉-语言模型,通过两项关键创新得到增强:HqDC-1.4M,一个包含140万组详细图像-标题配对的大规模高质量数据集,可提升空间感知与物体理解能力;以及 RSSA,首个自知数据集,旨在通过训练模型识别无法回答的问题来减少幻觉。H2RSVLM 在多个遥感基准测试中达到最先进性能,同时在面对无法回答的问题时展现出强大的拒绝能力。

ABSTRACT

This paper develops a Versatile and Honest vision language Model (VHM) for remote sensing image analysis. VHM is built on a large-scale remote sensing image-text dataset with rich-content captions (VersaD), and an honest instruction dataset comprising both factual and deceptive questions (HnstD). Unlike prevailing remote sensing image-text datasets, in which image captions focus on a few prominent objects and their relationships, VersaD captions provide detailed information about image properties, object attributes, and the overall scene. This comprehensive captioning enables VHM to thoroughly understand remote sensing images and perform diverse remote sensing tasks. Moreover, different from existing remote sensing instruction datasets that only include factual questions, HnstD contains additional deceptive questions stemming from the non-existence of objects. This feature prevents VHM from producing affirmative answers to nonsense queries, thereby ensuring its honesty. In our experiments, VHM significantly outperforms various vision language models on common tasks of scene classification, visual question answering, and visual grounding. Additionally, VHM achieves competent performance on several unexplored tasks, such as building vectorizing, multi-label classification and honest question answering. We will release the code, data and model weights at https://github.com/opendatalab/VHM .

研究动机与目标

  • 为解决通用大型视觉-语言模型(VLM)在遥感(RS)任务中因领域特定图像特征和空间感知能力有限而导致的性能不佳问题。
  • 克服现有遥感专用视觉-语言模型(RSVLM)的局限性,这些模型因训练数据不足且对无法回答的问题缺乏鲁棒性而表现受限。
  • 构建一个大规模、高质量的遥感视觉-语言数据集(HqDC-1.4M),包含详细、富含属性的标题,以增强模型的理解与空间推理能力。
  • 提出 RSSA,首个专为提升视觉-语言模型自知能力并减少幻觉而设计的数据集,通过引入无法回答的问题示例进行训练。
  • 构建并评估 H2RSVLM,一种在遥感图像分析任务中兼具高帮助性与诚实性的模型。

提出的方法

  • 利用 Gemini-Vision 构建 HqDC-1.4M,一个包含140万张图像-标题配对的数据集,生成丰富、详细的标题,涵盖物体类型、属性(颜色、形状、位置)以及季节性变化等动态特征。
  • 设计提示工程策略,从视觉-语言模型中激发全面、流畅且富含属性的描述,从而增强空间感知与定位能力。
  • 通过在标准视觉问答任务中注入无法回答的问题,构建 RSSA 自知数据集,用于训练模型拒绝错误生成。
  • 使用涵盖分类、视觉问答(VQA)和视觉定位任务的多任务指令数据集(RS-ClsQaGrd-Instruct)对视觉编码器(来自 CLIP 的 ViT)和语言头进行微调。
  • 将 HqDC-1.4M 和 RSSA 整合进统一的训练流程,联合优化 H2RSVLM 架构在帮助性与诚实性方面的表现。
  • 在多个公开遥感基准上评估模型,包括 RS-ClsQaGrd-Instruct、RS-Specialized-Instruct 和 RSSA,采用任务特定指标。

实验结果

研究问题

  • RQ1大规模、高质量的视觉-语言数据集是否能显著提升遥感 VLM 的空间感知与物体理解能力?
  • RQ2通过无法回答的问题进行自知训练,在多大程度上能减少遥感 VLM 中的幻觉?
  • RQ3详细标题配对与自知数据的结合,如何在单一 VLM 中同时提升帮助性与诚实性?
  • RQ4H2RSVLM 是否能在多样化的遥感任务中实现泛化,包括分类、计数、视觉定位与矢量化?
  • RQ5与基线模型相比,H2RSVLM 在无法回答问题上的表现如何?是否展现出可靠的拒绝行为?

主要发现

  • H2RSVLM 在多个遥感基准测试中达到最先进性能,分类任务在 GID 上 F1 分数达 85.77%,在 FBP 上达 72.20%。
  • 在视觉定位任务中,H2RSVLM 在 CrowdAI-val 上实现 70.41% 的 C-IoU,表明其具有出色的定位准确性。
  • 在计数任务中,H2RSVLM 实现 6.22 的平均绝对误差(MAE),表明其具备强大的物体计数能力。
  • H2RSVLM 在 RSSA 基准的无法回答问题上展现出稳健的拒绝行为,有效减少了幻觉。
  • 可视化结果表明,H2RSVLM 在视觉定位任务中对大物体表现良好,但对小物体表现较弱,可能由于输入分辨率限制(336×336)。
  • 定性结果验证了模型在多标签地表覆盖分类、图像类型识别和地面采样距离估计方面表现优异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。