[论文解读] SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
本文提出了 SciInstruct,一个高质量、具备自我反思能力的科学推理指令标注数据集,以及 SciGLM,一系列经过微调的科学语言模型。通过基于大语言模型的自我反思框架生成并修正推理步骤,作者构建了一个涵盖数学、物理、化学和形式化证明的多样化数据集,使科学与数学推理性能显著提升,同时不损害基础语言能力。
Large Language Models (LLMs) have shown promise in assisting scientific discovery. However, such applications are currently limited by LLMs' deficiencies in understanding intricate scientific concepts, deriving symbolic equations, and solving advanced numerical calculations. To bridge these gaps, we introduce SciInstruct, a suite of scientific instructions for training scientific language models capable of college-level scientific reasoning. Central to our approach is a novel self-reflective instruction annotation framework to address the data scarcity challenge in the science domain. This framework leverages existing LLMs to generate step-by-step reasoning for unlabelled scientific questions, followed by a process of self-reflective critic-and-revise. Applying this framework, we curated a diverse and high-quality dataset encompassing physics, chemistry, math, and formal proofs. We analyze the curated SciInstruct from multiple interesting perspectives (e.g., domain, scale, source, question type, answer length, etc.). To verify the effectiveness of SciInstruct, we fine-tuned different language models with SciInstruct, i.e., ChatGLM3 (6B and 32B), Llama3-8B-Instruct, and Mistral-7B: MetaMath, enhancing their scientific and mathematical reasoning capabilities, without sacrificing the language understanding capabilities of the base model. We release all codes and SciInstruct at https://github.com/THUDM/SciGLM.
研究动机与目标
- 解决用于训练科学专用语言模型的高质量、富含推理能力的科学指令数据稀缺问题。
- 在狭义数学任务之外,提升大语言模型在物理、化学和形式化证明等领域的科学推理能力。
- 开发一种可扩展的、由人工智能驱动的标注框架,在通过自我反思和错误修正保持高质量的同时,减少对人工标注的依赖。
- 证明在多样化、高质量的科学指令数据上进行微调,可显著提升模型在多个基准测试中的推理性能。
- 发布 SciInstruct、SciGLM 和自我反思框架,以支持科学人工智能领域的开放研究。
提出的方法
- 采用基于大语言模型的自我反思式指令标注框架,让大语言模型生成推理步骤,并基于错误答案自我批判与修正其输出。
- 利用大语言模型生成正样本和负样本,以训练数据分类器,从而过滤噪声或低质量的指令。
- 通过整合来自数学、物理、化学以及 Lean 中的形式化证明的精选科学问题,结合逐步推理过程与经验证的答案,构建 SciInstruct 数据集。
- 在 SciInstruct 上微调 ChatGLM3 系列模型(6B、12B、32B),构建 SciGLM,以增强科学推理能力,同时保持基础语言理解能力。
- 应用多阶段数据处理流水线:初始大语言模型生成、错误的自我反思、答案验证,以及基于分类器的高质量数据过滤。
- 利用现有大语言模型自主生成并优化推理链,最大限度减少人工标注,同时通过迭代式自我批判确保正确性。

实验结果
研究问题
- RQ1基于大语言模型的自我反思框架能否在极少人工干预的情况下生成高质量的科学指令数据?
- RQ2在像 SciInstruct 这样多样化、富含推理能力的数据集上进行微调,能否显著提升大语言模型在多个科学领域中的推理能力?
- RQ3通过此类数据增强推理能力,是否能在不降低通用语言理解能力的前提下,提升科学基准测试中的表现?
- RQ4合成的、自我标注的数据在多大程度上能与人工标注的指令数据集在科学推理任务中表现相当甚至更优?
- RQ5利用大语言模型与分类器构建的自我改进数据流水线,能否有效过滤出科学领域中噪声或错误的指令?
主要发现
- 在 SciInstruct 上微调的 SciGLM 模型在 CEval-Sci 和 SciEval 基准测试中达到最先进性能,优于基础的 ChatGLM3-6B-Base 模型以及参数量大几个数量级的更大模型。
- 自我反思式标注框架成功在极少人工输入下生成高质量推理步骤,显著提升了数据质量与模型性能。
- SciGLM 在实现科学推理能力显著提升的同时,保持了强大的基础语言理解能力,表明通用能力与专业能力之间不存在权衡。
- 模型在所有测试的参数规模(6B、12B、32B)上均表现出一致的性能提升,证明了训练方法的可扩展性与泛化能力。
- 流水线中使用的数据分类器有效提升了指令质量,未来通过数据的自举式迭代可进一步增强模型性能。
- SciInstruct、SciGLM 与自我反思框架的发布,为科学语言建模与推理研究提供了更广泛的支持。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。