[论文解读] InstructionGPT-4: A 200-Instruction Paradigm for Fine-Tuning MiniGPT-4
本文提出 InstructionGPT-4,一种在仅 200 个高质量指令跟随样本(原始 MiniGPT-4 数据集的 6%)上微调的多模态大语言模型,采用可训练的数据选择器,通过新颖的指标评估并过滤低质量视觉-语言数据。该模型在多个基准测试中表现优于 MiniGPT-4,MME 得分提升 +23 分,VQA 和 MMBench 任务表现更优,证明在指令微调中数据质量优于数量。
Multimodal large language models are typically trained in two stages: first pre-training on image-text pairs, and then fine-tuning using supervised vision-language instruction data. Recent studies have shown that large language models can achieve satisfactory results even with a limited amount of high-quality instruction-following data. In this paper, we introduce InstructionGPT-4, which is fine-tuned on a small dataset comprising only 200 examples, amounting to approximately 6\% of the instruction-following data used in the alignment dataset for MiniGPT-4. To achieve this, we first propose several metrics to access the quality of multimodal instruction data. Based on these metrics, we present an effective and trainable data selector to automatically identify and filter low-quality vision-language data. By employing this method, InstructionGPT-4 outperforms the original MiniGPT-4 on various evaluations. Overall, our findings demonstrate that less but high-quality instruction tuning data is efficient in enabling multimodal large language models to generate better output. Our code is available at https://github.com/waltonfuture/InstructionGPT-4.
研究动机与目标
- 探究显著减少但高质量的指令数据是否可在多模态大语言模型中超越标准大规模指令微调。
- 解决高质量视觉-语言指令数据收集缺乏明确指导准则的问题。
- 开发一种稳健的自动化数据选择流程,从现有数据集中识别并过滤低质量的多模态指令样本。
- 评估数据质量指标与聚类方法在提升模型对齐与性能方面的有效性。
- 证明较少但更高品质的数据可实现优于更大、更嘈杂数据集的泛化能力与性能。
提出的方法
- 提出五项新颖指标——CLIP Score、GPT Score、Reward Score、Length Score 以及多模态特征嵌入,用于评估视觉-语言指令数据的质量。
- 使用谱聚类将原始的 3.4K 条指令数据划分为多样化且具代表性的聚类,以实现均衡评估。
- 训练一个自注意力网络作为数据选择器,学习数据嵌入与基于验证集上模型表现得出的真实质量标签之间的关系。
- 将训练好的数据选择器应用于各聚类,对样本进行排序并选取高质量样本,形成经筛选的 200 个样本数据集。
- 使用与原始 MiniGPT-4 相同的超参数,在选定的 200 个样本上对 MiniGPT-4 进行微调,以确保公平比较。
- 开展消融研究,验证聚类与特征维度对数据选择性能的影响。
实验结果
研究问题
- RQ1当微调仅使用 200 个高质量指令样本而非数千个标准数据点时,多模态大语言模型是否能实现更优性能?
- RQ2与随机或未过滤采样相比,自动化数据选择器在识别高质量视觉-语言指令数据方面的有效性如何?
- RQ3哪些指标与特征最能与下游多模态基准的实际模型性能相关联?
- RQ4将谱聚类整合到数据选择流程中是否能提升筛选数据集的多样性与代表性?
- RQ5要超越在全规模指令数据集上训练的模型性能,所需的有效最小数据量是多少?
主要发现
- InstructionGPT-4 在 MME 基准测试中相比 MiniGPT-4 实现 +23 分的显著提升,证明在极小数据量下亦可获得强大性能。
- 该模型在 MME 基准测试的 14 项任务中有 8 项表现优于 MiniGPT-4,并在 LVLM-eHub 评估套件中的全部四项 VQA 数据集上表现卓越。
- MMBench 得分提升 +1.55 分,VQA 数据集相对提升 +1.76%,证实其在多样化多模态任务中的一致优越性。
- 消融研究显示,聚类在所有架构中均提升了数据选择器性能,证明其在多样性与泛化能力方面具有关键作用。
- 仅选择 50 个数据点即可实现 VQA 性能提升,但要全面超越 MiniGPT-4 在更广泛基准上的表现,仍需 200 个样本,表明其具有强大的迁移能力。
- 将多模态特征维度设置为 6 时性能最优,因更低维度会过度压缩特征,更高维度则增加过拟合风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。