[论文解读] Instruction Pre-Training: Language Models are Supervised Multitask Learners
本文提出指令预训练(Instruction Pre-Training)方法,通过使用基于开源模型的指令合成器生成的2亿条合成指令-响应对,增强原始语料库,从而提升语言模型的预训练效果。该方法使Llama3-8B等模型在持续预训练中达到或超越Llama3-70B的性能,同时提升泛化能力和指令微调效果。
Unsupervised multitask pre-training has been the critical method behind the recent success of language models (LMs). However, supervised multitask learning still holds significant promise, as scaling it in the post-training stage trends towards better generalization. In this paper, we explore supervised multitask pre-training by proposing Instruction Pre-Training, a framework that scalably augments massive raw corpora with instruction-response pairs to pre-train LMs. The instruction-response pairs are generated by an efficient instruction synthesizer built on open-source models. In our experiments, we synthesize 200M instruction-response pairs covering 40+ task categories to verify the effectiveness of Instruction Pre-Training. In pre-training from scratch, Instruction Pre-Training not only consistently enhances pre-trained base models but also benefits more from further instruction tuning. In continual pre-training, Instruction Pre-Training enables Llama3-8B to be comparable to or even outperform Llama3-70B. Our model, code, and data are available at https://github.com/microsoft/LMOps.
研究动机与目标
- 探索监督多任务预训练作为无监督预训练的可扩展替代方案在语言模型中的潜力。
- 解决通过从原始文本生成高质量、多样化指令-响应对来扩展监督多任务学习的挑战。
- 基于开源模型开发一种成本效益高的指令合成器,以实现大规模数据增强。
- 评估指令预训练在从零开始预训练和在特定领域数据上进行持续预训练中的有效性。
- 证明指令增强的预训练能够提升下游任务的泛化能力和指令微调性能。
提出的方法
- 使用由微调后的指令合成器生成的合成指令-响应对扩充原始预训练语料库。
- 在精选的多样化数据集上训练指令合成器,其中每个样本包含原始文本及基于该文本的多个指令-响应对。
- 采用70亿参数的开源语言模型作为指令合成器的基础,以确保成本效益和可扩展性。
- 通过将训练好的合成器应用于大规模原始文本语料库,生成超过40个任务类别的2亿条指令-响应对。
- 使用标准因果语言建模范式,在增强后的语料库上预训练语言模型。
- 在特定领域数据(如金融、生物医学)上应用持续预训练,利用指令增强的语料库以提升领域适应能力。
实验结果
研究问题
- RQ1当有效扩展时,监督多任务预训练是否能超越或匹配无监督预训练在语言模型性能上的表现?
- RQ2基于开源模型的合成器在生成高质量、多样化指令-响应对以用于预训练数据增强方面效果如何?
- RQ3指令预训练在多大程度上提升了泛化能力和下游指令微调性能?
- RQ4指令增强的预训练是否能使较小模型(如Llama3-8B)在特定领域设置下达到与更大模型(如Llama3-70B)相当的性能?
- RQ5在数据质量和多样性方面,哪些关键因素促成了指令增强预训练的成功?
主要发现
- 在1000亿 tokens 数据上通过指令预训练的5亿参数模型,其性能可与在3000亿 tokens 数据上预训练的10亿参数模型相媲美。
- 与标准预训练相比,经过指令预训练的模型在后续指令微调中表现出显著更高的性能增益。
- 在持续预训练中,Llama3-8B在指令增强数据上微调后,在金融和生物医学基准测试中表现达到或超过Llama3-70B。
- 在多样化数据集上训练的指令合成器,能有效泛化到未见过的原始文本,实现可扩展且高质量的数据合成。
- 合成的指令-响应对覆盖了40多个任务类别,具备高知识覆盖率和正确性,确保了有效的多任务学习。
- 该方法展现出强大的可迁移性和可扩展性,其结果在多个领域和模型尺寸上均得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。