[论文解读] SCITUNE: Aligning Large Language Models with Scientific Multimodal Instructions
本文提出 SciTune,一种两阶段框架,通过首先对齐视觉与文本信号中的科学概念,然后在科学推理任务上进行微调,实现大语言模型与科学多模态指令的对齐。由此产生的 LLaMA-SciTune 模型在 ScienceQA 基准测试中超越人类表现,并在零样本科学导向视觉理解任务中优于当前最先进(SOTA)的视觉-语言模型。
Instruction finetuning is a popular paradigm to align large language models (LLM) with human intent. Despite its popularity, this idea is less explored in improving the LLMs to align existing foundation models with scientific disciplines, concepts and goals. In this work, we present SciTune as a tuning framework to improve the ability of LLMs to follow scientific multimodal instructions. To test our methodology, we use a human-generated scientific instruction tuning dataset and train a large multimodal model LLaMA-SciTune that connects a vision encoder and LLM for science-focused visual and language understanding. In comparison to the models that are finetuned with machine generated data only, LLaMA-SciTune surpasses human performance on average and in many sub-categories on the ScienceQA benchmark.
研究动机与目标
- 为解决通过指令微调对齐大语言模型与科学学科、概念及目标的差距。
- 通过利用人类生成的科学指令数据,提升科学语境下的多模态推理能力。
- 开发一种框架,增强大语言模型在多模态环境中遵循精确科学流程与协议的能力。
- 实现在科学导向视觉与语言理解任务中的零样本泛化能力。
- 通过针对性的指令微调,在科学多模态推理基准测试中超越人类表现。
提出的方法
- SciTune 采用两阶段训练流程:科学概念对齐,随后进行科学指令微调。
- 科学概念对齐涉及从多样的科学视觉信号(如图表、公式、示意图)和文本信号(如 OCR 结果、图注、段落提及)中学习。
- 科学指令微调在多模态科学推理数据集上进行,具体为包含 21,000 个多模态选择题的 ScienceQA 基准测试。
- 该框架应用于基于解码器的大语言模型(LLaMA)和视觉编码器(CLIP),形成 LLaMA-SciTune 模型。
- 该方法使用人类标注的科学指令数据,而非合成数据,以避免分布偏移并提升事实一致性。
- 在零样本推理设置下评估模型,以衡量其在未见科学视觉理解任务中的泛化能力。

实验结果
研究问题
- RQ1两阶段指令微调框架是否能提升大语言模型遵循科学多模态指令的能力?
- RQ2在人类生成的科学指令数据上进行训练,是否能带来优于在合成数据上训练的模型性能?
- RQ3在科学任务上微调的视觉-语言模型,是否能在科学推理基准测试中超越人类表现?
- RQ4该模型在零样本科学视觉理解任务中如何实现泛化?
- RQ5推理中的失败模式是什么?语言特征与视觉特征如何共同导致错误输出?
主要发现
- LLaMA-SciTune 在 ScienceQA 多模态推理基准测试中超越人类表现,在零样本推理中达到最先进结果。
- 该模型在分类科学视觉内容和生成准确图注方面,优于现有 SOTA 视觉-语言模型,且无需示例演示。
- 对于错误答案,模型生成的讲解内容 ROUGE 分数更高(0.924),高于正确答案的 ROUGE 分数(0.861),表明可能存在对讲解内容的记忆过拟合。
- 当答案正确时,模型在生成解题过程中的 BLEU 和 ROUGE 分数更高(如正确解题的 ROUGE 达 0.937),而错误答案的 ROUGE 分数为 0.778。
- 语言特征在常识事实和隐喻语言方面表现较弱,而视觉特征在计数和物体属性检索(如颜色、纹理)方面存在困难。
- 推理失败通常源于解题阶段的错误推理,表明在训练和推理过程中需要更优的思维链(chain-of-thought)引导。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。