[论文解读] Panda LLM: Training Data and Evaluation for Open-Sourced Chinese Instruction-Following Large Language Models
Panda LLM 首次推出了开源的中文指令跟随型大语言模型,通过在多样化的高质量中文数据集(包括中文维基、新闻和 COIG)上进行两阶段微调训练,实现了开源中文大模型中的最先进性能,并公开了模型权重、数据和代码,以促进人工智能的透明性、可信度与普及化。
This project focuses on enhancing open-source large language models through instruction-tuning and providing comprehensive evaluations of their performance. We explore how various training data factors, such as quantity, quality, and linguistic distribution, influence the performance of instruction-tuned models trained on publicly accessible high-quality instruction datasets for both English and Chinese languages. Our goal is to supplement evaluation with quantitative analyses, providing valuable insights for the continued advancement of open-source chat models. Our model, data, and code are publicly available for others to use and build upon.
研究动机与目标
- 开发一个可信、透明且可定制的开源中文指令跟随型大语言模型。
- 探究训练数据因素(数量、质量与语言分布)对指令微调模型性能的影响。
- 首次对现有开源中文大语言模型进行全面评估。
- 通过公开模型检查点、训练数据与源代码,实现对高质量中文大语言模型的广泛可及性。
- 通过为研究人员、开发者及中小型企业提供可访问、可定制的大语言模型,推动人工智能的普及化。
提出的方法
- 采用两阶段训练方法对 LLaMA 基础模型进行微调:先在多样化的中文语料上进行预训练,再进行指令微调。
- 从五个中文单语语料库和 COIG 数据集构建高质量的指令微调数据集,覆盖多样化领域与语言风格。
- 采用指令微调方法,使用提示模板:"Human: [instruction]\n\nAssistant: [response]",遵循 Wei 等人(2021)的方法。
- 采用 LLaMA 模型架构,并引入改进,如预归一化、SwiGLU 激活函数与旋转位置编码。
- 由于许可限制,以相对于原始 LLaMA 权重的参数差异形式发布模型权重,并提供转换脚本。
- 使用总计 1.4T 标记的七个公开可用数据集混合进行预训练,针对 7B、13B、33B 和 65B 参数版本调整超参数。
实验结果
研究问题
- RQ1训练数据的数量、质量与语言分布的变化如何影响指令微调中文大语言模型的性能?
- RQ2开源中文指令跟随型大语言模型之间的相对性能如何?Panda LLM 的表现如何?
- RQ3两阶段训练方法(预训练 + 指令微调)是否能在中文指令跟随任务上实现更优性能?
- RQ4在无法访问专有数据或模型的情况下,开源中文大语言模型在多大程度上可实现最先进结果?
- RQ5如何使开源大语言模型更具透明性、可信度与可定制性,以支持全球使用?
主要发现
- Panda LLM 在同等参数规模的指令跟随基准测试中,优于所有此前可用的开源中文大语言模型。
- 两阶段训练方法——即在多样化中文语料上进行预训练,随后进行指令微调——显著提升了模型的指令跟随能力。
- 该模型在多种指令类型(包括推理、摘要生成与问答)上展现出强大的零样本泛化能力。
- 评估结果揭示了现有开源中文大语言模型之间存在显著的性能差距,凸显了高质量训练数据与微调的重要性。
- 通过以相对于 LLaMA 的参数差异形式发布模型权重,实现了用户对原始 LLaMA 权重的完整可重现性与可定制性。
- 本项目为未来开源、可扩展且多语言的大语言模型奠定了基础,计划发布更大规模的模型,如 Panda-13B 和 Panda-33B。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。