[论文解读] ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
本文提出 ALLaVA,一个参数量为 3B 的视觉语言模型,通过在高质量、由 GPT-4V 生成的合成数据上进行训练,在 12 项基准测试中实现了具有竞争力的性能。通过利用 GPT-4V 生成的合成字幕、复杂指令和详细回答,ALLaVA 缩小了轻量级与全尺寸视觉语言模型(LVLM)之间的性能差距,在模型参数量较小的情况下,仍优于更大规模的模型在关键任务上的表现。
Large vision-language models (LVLMs) have shown premise in a broad range of vision-language tasks with their strong reasoning and generalization capabilities. However, they require considerable computational resources for training and deployment. This study aims to bridge the performance gap between traditional-scale LVLMs and resource-friendly lite versions by adopting high-quality training data. To this end, we propose a comprehensive pipeline for generating a synthetic dataset. The key idea is to leverage strong proprietary models to generate (i) fine-grained image annotations for vision-language alignment and (ii) complex reasoning visual question-answering pairs for visual instruction fine-tuning, yielding 1.3M samples in total. We train a series of lite VLMs on the synthetic dataset and experimental results demonstrate the effectiveness of the proposed scheme, where they achieve competitive performance on 17 benchmarks among 4B LVLMs, and even perform on par with 7B/13B-scale models on various benchmarks. This work highlights the feasibility of adopting high-quality data in crafting more efficient LVLMs. We name our dataset extit{ALLaVA}, and open-source it to research community for developing better resource-efficient LVLMs for wider usage.
研究动机与目标
- 通过高质量训练数据,弥合轻量级与全尺寸视觉语言模型(LVLM)之间的性能差距。
- 开发一种可扩展、以数据为中心的方法,用于生成高保真度的多模态训练数据,而无需依赖人工标注的数据集。
- 评估 GPT-4V 生成的合成数据是否能够有效训练出一个轻量级 LVLM,使其性能达到或超过更大规模模型的水平。
- 开源一个大规模、高质量的合成数据集,用于 LVLM 训练,包含 140 万条样本,附带详细字幕和指令。
提出的方法
- 利用 GPT-4V 为 140 万张图像生成细粒度图像字幕、复杂推理指令和详细回答。
- 构建了两个独立的合成数据集:用于视觉-文本对齐的 ALLaVA-Caption-4V 和用于视觉指令微调的 ALLaVA-Instruct-4V。
- 采用两阶段流水线训练一个 3B 参数的语言模型(Phi2),结合视觉编码器:先在对齐数据上进行预训练,再在指令数据上进行微调。
- 采用以数据为中心的框架,优先保证数据质量而非数量,最大限度减少低质量字幕带来的噪声信号。
- 在 12 项基准测试中评估模型性能,包括 MME、GQA 和 MM-Vet,与 SOTA 模型(如 LLaVA-v1.6-34B 和 GPT-4V)进行对比。
- 开展消融实验,以分离评估每个合成数据集在不同训练阶段对模型性能的影响。

实验结果
研究问题
- RQ1来自 GPT-4V 的高质量合成数据能否弥合轻量级与大规模 LVLM 之间的性能差距?
- RQ2使用 GPT-4V 生成复杂且详细的指令与回答,是否能提升小型视觉语言模型的推理与对齐能力?
- RQ3在使用合成数据时,两阶段训练流程(先在对齐数据上预训练,再进行指令微调)有多高效?
- RQ4当在高质量合成数据上进行训练时,一个 3B 参数的模型能否实现与 13B–34B 模型相当的性能?
主要发现
- ALLaVA 在 MME 基准上取得 1623.2 分,在 GQA 基准上取得 50.0 分,均优于 LLaVA-v1.5-13B 模型。
- 该模型在 MM-Vet 基准上取得 33.2 分,表明其虽参数量小,但具备强大的多模态推理能力。
- 消融实验表明,同时使用 ALLaVA-Caption-4V 和 ALLaVA-Instruct-4V 能获得最佳性能,两者联合使用时 MM-Vet 得分为 32.2。
- Phi2-2.7B 主干模型在所有基准测试中均优于更大的 LLM(如 Qwen-1.8B 和 StableLM-2-1.6B),表明其与合成数据具有极强的兼容性。
- 在两个定性示例中,ALLaVA 的推理质量与 GPT-4V 相当或更优,尤其在情感识别和幽默理解方面表现突出。
- 开源的 140 万条样本数据集是迄今为止最大的 GPT-4V 生成的 LVLM 训练合成数据集,为未来以数据为中心的多模态学习研究提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。