[论文解读] What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
本文研究了提升多模态大语言模型(MLLMs)视觉指令有效性的关键因素,发现复杂视觉推理任务能显著提升模型性能。作者提出一种合成-复杂化-重构框架,自动生成32K个高质量、复杂的视觉推理指令(ComVint),该数据集可一致地提升MLLM性能——例如,使MiniGPT-4和BLIP-2在MME-Cognition上的准确率分别提升32.6%和28.8%。
Visual instruction tuning is crucial for enhancing the zero-shot generalization capability of Multi-modal Large Language Models (MLLMs). In this paper, we aim to investigate a fundamental question: ''what makes for good visual instructions''. Through a comprehensive empirical study, we find that instructions focusing on complex visual reasoning tasks are particularly effective in improving the performance of MLLMs, with results correlating to instruction complexity. Based on this insight, we develop a systematic approach to automatically create high-quality complex visual reasoning instructions. Our approach employs a synthesize-complicate-reformulate paradigm, leveraging multiple stages to gradually increase the complexity of the instructions while guaranteeing quality. Based on this approach, we create the ComVint dataset with 32K examples, and fine-tune four MLLMs on it. Experimental results consistently demonstrate the enhanced performance of all compared MLLMs, such as a 27.86% and 27.60% improvement for LLaVA on MME-Perception and MME-Cognition, respectively. Our code and data are publicly available at the link: https://github.com/RUCAIBox/ComVint.
研究动机与目标
- 识别影响视觉指令有效性的关键因素,以提升多模态大语言模型的性能。
- 探究任务类型、指令复杂度或注释多样性中,哪一因素对MLLM性能影响最大。
- 开发一种自动化、系统化的高质量复杂视觉推理指令生成方法。
- 构建一个大规模合成数据集,以提升MLLM在多样化基准上的零样本泛化能力。
- 评估指令复杂度和格式对模型在多个基准上性能的影响。
提出的方法
- 采用合成-复杂化-重构流水线生成复杂视觉推理指令。
- 初始指令通过GPT-4生成,提示词基于图像注释(如标题、物体)进行构建。
- 通过“复杂化-验证”循环迭代提升指令复杂度,同时保持事实一致性和质量。
- 重构模块将指令转换为多种格式(开放式、布尔问答、多选问答),以增强下游适应性。
- 该方法生成两类推理:基于图像内容的跨模态推理,以及需要外部知识的外部知识推理。
- 最终数据集ComVint包含32K个样本,并已公开发布,可用于微调MLLM。
实验结果
研究问题
- RQ1在视觉指令微调中,哪些任务类型最能有效提升MLLM性能?
- RQ2指令复杂度与任务多样性、注释粒度相比,对提升模型能力的影响如何?
- RQ3能否通过自动化流水线生成无幻觉的高质量复杂视觉推理指令?
- RQ4指令格式(如开放式与多选题)如何影响不同基准上模型的性能?
- RQ5为最大化MLLM泛化能力,视觉推理指令的最优复杂度水平是什么?
主要发现
- 复杂视觉推理任务在评估基准上显著优于图像字幕和视觉问答任务,能更有效地提升MLLM性能。
- 提升指令复杂度带来的性能增益,超过增强任务多样性或添加细粒度注释的效果。
- ComVint数据集包含32K个合成的复杂视觉推理指令,使MiniGPT-4和BLIP-2在MME-Cognition上的性能分别提升32.6%和28.8%。
- 复杂化模块显著提升性能:首轮复杂化使跨模态推理平均提升约1分,第二轮复杂化使外部知识推理提升超过1分。
- 指令格式具有影响:在SEED-Bench上,布尔问答格式准确率最高;在MME-Perception上,多选题格式表现最佳。
- 将三种指令格式(开放式、布尔问答、多选题)结合使用,在所有基准上均取得最高平均准确率,证明了格式多样性带来的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。