Skip to main content
QUICK REVIEW

[论文解读] An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models

Yadong Lu, Chunyuan Li|arXiv (Cornell University)|Sep 18, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本文通过使用 LLaVA 对从 7B 到 65B 参数的指令微调大型多模态模型(LMMs)进行了实证研究,表明增大模型规模可一致地提升多模态和语言能力。研究发现,LoRA/QLoRA 微调可实现与全模型微调相当的性能,而更高的图像分辨率以及混合多模态-语言数据能显著提升性能,甚至通过视觉指令微调可增强纯语言能力。

ABSTRACT

Visual instruction tuning has recently shown encouraging progress with open-source large multimodal models (LMM) such as LLaVA and MiniGPT-4. However, most existing studies of open-source LMM are performed using models with 13B parameters or smaller. In this paper we present an empirical study of scaling LLaVA up to 33B and 65B/70B, and share our findings from our explorations in image resolution, data mixing and parameter-efficient training methods such as LoRA/QLoRA. These are evaluated by their impact on the multi-modal and language capabilities when completing real-world tasks in the wild. We find that scaling LMM consistently enhances model performance and improves language capabilities, and performance of LoRA/QLoRA tuning of LMM are comparable to the performance of full-model fine-tuning. Additionally, the study highlights the importance of higher image resolutions and mixing multimodal-language data to improve LMM performance, and visual instruction tuning can sometimes improve LMM's pure language capability. We hope that this study makes state-of-the-art LMM research at a larger scale more accessible, thus helping establish stronger baselines for future research. Code and checkpoints will be made public.

研究动机与目标

  • 研究将大型语言模型(LLM)规模扩展至 13B 参数以上时,对多模态模型(LMM)性能的影响。
  • 评估参数高效微调方法(如 LoRA 和 QLoRA)在大规模 LMM 中的有效性。
  • 分析在训练过程中混合多模态数据与纯语言指令数据对 LMM 能力的影响。
  • 探讨视觉指令微调是否不仅能提升多模态能力,还能增强 LMM 的纯语言能力。
  • 为未来研究建立更强、公开可用的基线,使用更大规模的 LLaVA 检查点。

提出的方法

  • 通过两阶段训练流程,将 LLaVA 从 7B 扩展至 65B:(1) 通过投影头训练实现视觉特征对齐;(2) 在 LLaVA-80K 数据集上进行视觉指令微调,微调基于 Vicuna 的 LLM。
  • 同时应用全模型微调与参数高效方法(LoRA 和 QLoRA),以比较训练成本与性能之间的权衡。
  • 通过在第二阶段微调中混合 LLaVA-80K 多模态指令数据与 ShareGPT 纯语言指令数据,探索数据混合的影响。
  • 使用高分辨率图像输入(最高达 336x336),并评估其对视觉理解与推理能力的影响。
  • 采用 DeepSpeed 配合 ZeRO-3/ZeRO-2 实现高效训练,序列长度限制在 2048 个 token,学习率调度根据方法进行优化。
  • 进行了广泛的超参数搜索,特别是针对 LoRA,发现 LoRA alpha = 2 × rank 且学习率为 1×10⁻⁴ 时性能最优。

实验结果

研究问题

  • RQ1将 LLM 参数规模从 7B 扩展至 65B,对指令微调的 LMM 的多模态与语言能力有何影响?
  • RQ2在大规模 LMM 中,LoRA 和 QLoRA 等参数高效微调方法在性能上能多大程度上匹配全模型微调?
  • RQ3在训练过程中混合纯语言指令数据与多模态数据,如何影响多模态与语言能力之间的平衡?
  • RQ4视觉指令微调是否能提升 LMM 的纯语言能力,而不仅限于其多模态性能?
  • RQ5在真实任务中,为最大化 LMM 性能,最优的图像分辨率与数据整理策略是什么?

主要发现

  • 将 LLaVA 从 7B 扩展至 65B 后,LLaVA-Bench 性能从 65.9 提升至 72.3,65B 模型达到当前最先进水平。
  • LoRA 和 QLoRA 微调性能与全模型微调相当,65B LoRA 模型在 LLaVA-Bench 上达到 72.2 分,在 MM-VET 上达到 74.2 分。
  • 混合纯语言指令数据(如 ShareGPT)与多模态数据可提升多模态能力,但未增强语言性能,表明能力平衡存在权衡。
  • 视觉指令微调提升了纯语言能力:LLaVA-70B 在 MMLU 上得分达 65.1,超过基础 LLaMA-2-70B-Chat 模型(63.1),表明存在正向迁移效应。
  • 更高的图像分辨率(如 336x336)显著提升了视觉理解能力,所有模型规模均观察到性能提升。
  • 最优 LoRA 配置为 LoRA alpha = 2 × rank 且学习率为 1×10⁻⁴,更高秩(如 512)在超过 rank 64 后仅带来微小增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。