[论文解读] HoneyBee: Progressive Instruction Finetuning of Large Language Models for Materials Science
该论文提出了HoneyBee,一个专用于材料科学的十亿参数语言模型,通过MatSci-Instruct——一种注重可信度的渐进式两阶段框架进行训练,该框架利用教师模型生成并利用验证模型验证高质量、领域特定的指令数据。HoneyBee在MatSci-NLP基准测试中表现优于通用模型和基于BERT的模型,且在无需在材料科学文本上进行预训练的情况下,通过多轮迭代优化阶段性能持续提升。
We propose an instruction-based process for trustworthy data curation in materials science (MatSci-Instruct), which we then apply to finetune a LLaMa-based language model targeted for materials science (HoneyBee). MatSci-Instruct helps alleviate the scarcity of relevant, high-quality materials science textual data available in the open literature, and HoneyBee is the first billion-parameter language model specialized to materials science. In MatSci-Instruct we improve the trustworthiness of generated data by prompting multiple commercially available large language models for generation with an Instructor module (e.g. Chat-GPT) and verification from an independent Verifier module (e.g. Claude). Using MatSci-Instruct, we construct a dataset of multiple tasks and measure the quality of our dataset along multiple dimensions, including accuracy against known facts, relevance to materials science, as well as completeness and reasonableness of the data. Moreover, we iteratively generate more targeted instructions and instruction-data in a finetuning-evaluation-feedback loop leading to progressively better performance for our finetuned HoneyBee models. Our evaluation on the MatSci-NLP benchmark shows HoneyBee's outperformance of existing language models on materials science tasks and iterative improvement in successive stages of instruction-data refinement. We study the quality of HoneyBee's language modeling through automatic evaluation and analyze case studies to further understand the model's capabilities and limitations. Our code and relevant datasets are publicly available at \url{https://github.com/BangLab-UdeM-Mila/NLP4MatSci-HoneyBee}.
研究动机与目标
- 解决材料科学领域中高质量、领域特定文本数据稀缺的问题,以训练出高效的语言模型。
- 开发一种可信且可扩展的方法,利用大语言模型生成针对材料科学的定制化指令数据。
- 创建一个专用的高性能语言模型(HoneyBee),使其在材料科学自然语言处理任务中优于现有的通用模型和领域特定模型。
- 证明通过验证与反馈对指令数据进行迭代优化,可实现模型性能的逐步提升。
提出的方法
- MatSci-Instruct采用两阶段流程:首先,教师模型(如ChatGPT)生成材料科学领域的领域特定指令数据;其次,验证模型(如Claude)对生成的数据进行交叉验证,确保其准确性、相关性和合理性。
- 该框架采用反馈循环机制,对低质量数据根据评估者反馈进行优化,从而在多轮迭代中逐步提升指令数据的质量。
- HoneyBee基于经过筛选的MatSci-Instruct数据集,使用LLaMA架构进行微调,且未在材料科学语料上进行预训练。
- 通过MatSci-NLP基准测试评估模型性能,结合自动指标与案例研究,评估事实准确性、完整性与推理能力。
- 该方法利用商用大语言模型作为教师、验证者与评估者,确保数据筛选过程的可扩展性与可信度。
- 应用指令数据的多轮迭代优化,每轮均提升模型在下游材料科学任务中的表现。

实验结果
研究问题
- RQ1能否为材料科学等科学领域开发一种可信且可扩展的高质量指令数据生成框架?
- RQ2能否训练出一个专用于材料科学的大语言模型,使其在领域特定自然语言处理任务中优于通用模型和基于BERT的模型?
- RQ3通过验证与反馈对指令数据进行渐进式优化,是否能带来可测量的模型性能提升?
- RQ4一个仅在筛选后的指令数据上进行微调的模型,在未预训练材料科学文本的情况下,其零样本性能能达到何种水平?
主要发现
- HoneyBee-7b-Stage1在仅使用一轮MatSci-Instruct数据训练后,即在MatSci-NLP基准测试中超越LLaMA-7b与Alpaca-7b,展现出强大的零样本性能。
- HoneyBee-13b与HoneyBee-7b在MatSci-Instruct多轮迭代优化的各阶段中均表现出持续的性能提升,证实了迭代反馈机制的有效性。
- HoneyBee-13b在案例研究中表现接近ChatGPT,表明经过渐进式微调后,其推理能力与事实一致性均达到高水平。
- HoneyBee在多项MatSci-NLP任务(包括分类与生成)中优于最先进的基于BERT的模型(如MatBERT、MatSciBERT)以及通用大语言模型(如LLaMA、Alpaca)。
- 该模型在无需预训练材料科学文本的情况下即取得优异结果,凸显了MatSci-Instruct数据筛选流程的有效性。
- MatSci-Instruct框架能够构建高质量、领域特定的指令数据集,为开发专用的十亿参数材料科学大语言模型提供了支持。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。