[论文解读] To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning
本论文提出 LVIS-Instruct4V,一个由 GPT-4V 通过 LVIS 数据集中的图像和边界框标注进行提示生成的 220K 样本视觉指令数据集。通过利用 GPT-4V 的直接视觉理解能力,该方法生成了细粒度、上下文感知且视觉对齐的指令-答案对,显著提升了 LLaVA-1.5 在各类基准测试中的表现,包括在 MME 上取得 SOTA 结果(+43.6)和在 MM-Vet 上取得 +5.6% 的提升。
Existing visual instruction tuning methods typically prompt large language models with textual descriptions to generate instruction-following data. Despite the promising performance achieved, these descriptions are derived from image annotations, which are oftentimes coarse-grained. Furthermore, the instructions might even contradict the visual content without observing the entire visual context. To address this challenge, we introduce a fine-grained visual instruction dataset, LVIS-Instruct4V, which contains 220K visually aligned and context-aware instructions produced by prompting the powerful GPT-4V with images from LVIS. Through experimental validation and case studies, we demonstrate that high-quality visual instructional data could improve the performance of LLaVA-1.5, a state-of-the-art large multimodal model, across a wide spectrum of benchmarks by clear margins. Notably, by simply replacing the LLaVA-Instruct with our LVIS-Instruct4V, we achieve better results than LLaVA on most challenging LMM benchmarks, e.g., LLaVA$^w$ (76.7 vs. 70.7) and MM-Vet (40.2 vs. 35.4). We release our data and model at https://github.com/X2FD/LVIS-INSTRUCT4V.
研究动机与目标
- 解决现有视觉指令微调方法依赖于图像标注中粗粒度文本描述的局限性。
- 通过在数据生成过程中让大型多模态模型直接观察图像,提升指令遵循数据的准确性和视觉定位能力。
- 开发一个高质量、细粒度的视觉指令数据集,以提升多模态语言模型在复杂基准测试中的表现。
- 证明 GPT-4V 生成的指令数据优于纯文本提示生成的数据,从而在下游多模态推理任务中带来可测量的性能提升。
- 验证将标准指令数据替换为 LVIS-Instruct4V 可在具有挑战性的 LMM 基准测试中实现最先进性能。
提出的方法
- 利用具备直接视觉输入能力的 GPT-4V(视觉-语言模型)基于 LVIS 数据集中的原始图像及其边界框标注生成指令-答案对。
- 设计两阶段提示生成流程:第一阶段生成上下文感知的视觉对话;第二阶段生成基于视觉细节的高质量图像描述。
- 通过向 GPT-4V 同时输入图像及其局部化标注,筛选并构建 220,000 个视觉对齐且细粒度的指令-答案对。
- 仅使用 LVIS-Instruct4V 作为指令微调数据,对 LLaVA-1.5 进行微调,保持相同的模型架构和训练流程。
- 通过在训练中混合 LVIS-Instruct4V 与 LLaVA-Instruct 数据,进一步提升模型的泛化能力和鲁棒性。
- 开展消融实验,评估微调语言模型、训练周期长度以及数据混合策略的影响。
实验结果
研究问题
- RQ1当 GPT-4V 获得对图像的直接访问权限时,相比纯文本提示,是否能生成更准确、更具上下文感知的视觉指令数据?
- RQ2使用 GPT-4V 生成的指令数据在多大程度上能提升多模态模型在细粒度视觉推理基准测试中的表现?
- RQ3LVIS-Instruct4V 与 LLaVA-Instruct 等现有指令微调数据集相比,在视觉定位和模型泛化能力方面表现如何?
- RQ4在多种多模态基准测试中,混合使用 LVIS-Instruct4V 与 LLaVA-Instruct 数据对模型性能有何影响?
- RQ5指令数据的质量是否与在 MME 和 MM-Vet 等挑战性基准测试中的性能提升存在相关性?
主要发现
- 仅使用 LVIS-Instruct4V 微调的 LLaVA-1.5 在 LLaVA w 上达到 76.7 分,在 MM-Vet 上达到 40.2 分,优于原始 LLaVA 模型(70.7 和 35.4 分)。
- 在 LVIS-Instruct4V 上训练的 13B 模型在 VQAv2 上达到 80.7 分,超过 LLaVA-1.5 的 80.0 分。
- 将 LVIS-Instruct4V 与 LLaVA-Instruct 混合训练后,在 11 个基准测试中的 9 个上达到最先进性能,包括在 MME 上达到 1574.9 分(相比 LLaVA-1.5 提升 43.6 分)。
- 在 LVIS-Instruct4V 上训练的模型在场景文本识别方面表现更优,能正确识别图像中两个文本,而 LLaVA-1.5 错过了其中一个。
- 在细粒度视觉对比任务中,该模型能正确识别物体关系(如碗的位置),而 LLaVA-1.5 出现错误判断。
- 消融实验表明,即使语言模型冻结,LVIS-Instruct4V 也能提升 MME 表现(1544.3 vs. 1531.3),而进一步微调模型可将分数提升至 1581.3。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。