[论文解读] An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models
本文通过使用 LLaVA 对从 7B 到 65B 参数的指令微调大型多模态模型(LMMs)进行了实证研究,表明增大模型规模可一致地提升多模态和语言能力。研究发现,LoRA/QLoRA 微调可实现与全模型微调相当的性能,而更高的图像分辨率以及混合多模态-语言数据能显著提升性能,甚至通过视觉指令微调可增强纯语言能力。
Visual instruction tuning has recently shown encouraging progress with open-source large multimodal models (LMM) such as LLaVA and MiniGPT-4. However, most existing studies of open-source LMM are performed using models with 13B parameters or smaller. In this paper we present an empirical study of scaling LLaVA up to 33B and 65B/70B, and share our findings from our explorations in image resolution, data mixing and parameter-efficient training methods such as LoRA/QLoRA. These are evaluated by their impact on the multi-modal and language capabilities when completing real-world tasks in the wild. We find that scaling LMM consistently enhances model performance and improves language capabilities, and performance of LoRA/QLoRA tuning of LMM are comparable to the performance of full-model fine-tuning. Additionally, the study highlights the importance of higher image resolutions and mixing multimodal-language data to improve LMM performance, and visual instruction tuning can sometimes improve LMM's pure language capability. We hope that this study makes state-of-the-art LMM research at a larger scale more accessible, thus helping establish stronger baselines for future research. Code and checkpoints will be made public.
研究动机与目标
- 研究将大型语言模型(LLM)规模扩展至 13B 参数以上时,对多模态模型(LMM)性能的影响。
- 评估参数高效微调方法(如 LoRA 和 QLoRA)在大规模 LMM 中的有效性。
- 分析在训练过程中混合多模态数据与纯语言指令数据对 LMM 能力的影响。
- 探讨视觉指令微调是否不仅能提升多模态能力,还能增强 LMM 的纯语言能力。
- 为未来研究建立更强、公开可用的基线,使用更大规模的 LLaVA 检查点。
提出的方法
- 通过两阶段训练流程,将 LLaVA 从 7B 扩展至 65B:(1) 通过投影头训练实现视觉特征对齐;(2) 在 LLaVA-80K 数据集上进行视觉指令微调,微调基于 Vicuna 的 LLM。
- 同时应用全模型微调与参数高效方法(LoRA 和 QLoRA),以比较训练成本与性能之间的权衡。
- 通过在第二阶段微调中混合 LLaVA-80K 多模态指令数据与 ShareGPT 纯语言指令数据,探索数据混合的影响。
- 使用高分辨率图像输入(最高达 336x336),并评估其对视觉理解与推理能力的影响。
- 采用 DeepSpeed 配合 ZeRO-3/ZeRO-2 实现高效训练,序列长度限制在 2048 个 token,学习率调度根据方法进行优化。
- 进行了广泛的超参数搜索,特别是针对 LoRA,发现 LoRA alpha = 2 × rank 且学习率为 1×10⁻⁴ 时性能最优。
实验结果
研究问题
- RQ1将 LLM 参数规模从 7B 扩展至 65B,对指令微调的 LMM 的多模态与语言能力有何影响?
- RQ2在大规模 LMM 中,LoRA 和 QLoRA 等参数高效微调方法在性能上能多大程度上匹配全模型微调?
- RQ3在训练过程中混合纯语言指令数据与多模态数据,如何影响多模态与语言能力之间的平衡?
- RQ4视觉指令微调是否能提升 LMM 的纯语言能力,而不仅限于其多模态性能?
- RQ5在真实任务中,为最大化 LMM 性能,最优的图像分辨率与数据整理策略是什么?
主要发现
- 将 LLaVA 从 7B 扩展至 65B 后,LLaVA-Bench 性能从 65.9 提升至 72.3,65B 模型达到当前最先进水平。
- LoRA 和 QLoRA 微调性能与全模型微调相当,65B LoRA 模型在 LLaVA-Bench 上达到 72.2 分,在 MM-VET 上达到 74.2 分。
- 混合纯语言指令数据(如 ShareGPT)与多模态数据可提升多模态能力,但未增强语言性能,表明能力平衡存在权衡。
- 视觉指令微调提升了纯语言能力:LLaVA-70B 在 MMLU 上得分达 65.1,超过基础 LLaMA-2-70B-Chat 模型(63.1),表明存在正向迁移效应。
- 更高的图像分辨率(如 336x336)显著提升了视觉理解能力,所有模型规模均观察到性能提升。
- 最优 LoRA 配置为 LoRA alpha = 2 × rank 且学习率为 1×10⁻⁴,更高秩(如 512)在超过 rank 64 后仅带来微小增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。