Skip to main content
QUICK REVIEW

[论文解读] Panda LLM: Training Data and Evaluation for Open-Sourced Chinese Instruction-Following Large Language Models

Fangkai Jiao, Bosheng Ding|arXiv (Cornell University)|May 4, 2023
Natural Language Processing Techniques被引用 4
一句话总结

Panda LLM 首次推出了开源的中文指令跟随型大语言模型,通过在多样化的高质量中文数据集(包括中文维基、新闻和 COIG)上进行两阶段微调训练,实现了开源中文大模型中的最先进性能,并公开了模型权重、数据和代码,以促进人工智能的透明性、可信度与普及化。

ABSTRACT

This project focuses on enhancing open-source large language models through instruction-tuning and providing comprehensive evaluations of their performance. We explore how various training data factors, such as quantity, quality, and linguistic distribution, influence the performance of instruction-tuned models trained on publicly accessible high-quality instruction datasets for both English and Chinese languages. Our goal is to supplement evaluation with quantitative analyses, providing valuable insights for the continued advancement of open-source chat models. Our model, data, and code are publicly available for others to use and build upon.

研究动机与目标

  • 开发一个可信、透明且可定制的开源中文指令跟随型大语言模型。
  • 探究训练数据因素(数量、质量与语言分布)对指令微调模型性能的影响。
  • 首次对现有开源中文大语言模型进行全面评估。
  • 通过公开模型检查点、训练数据与源代码,实现对高质量中文大语言模型的广泛可及性。
  • 通过为研究人员、开发者及中小型企业提供可访问、可定制的大语言模型,推动人工智能的普及化。

提出的方法

  • 采用两阶段训练方法对 LLaMA 基础模型进行微调:先在多样化的中文语料上进行预训练,再进行指令微调。
  • 从五个中文单语语料库和 COIG 数据集构建高质量的指令微调数据集,覆盖多样化领域与语言风格。
  • 采用指令微调方法,使用提示模板:"Human: [instruction]\n\nAssistant: [response]",遵循 Wei 等人(2021)的方法。
  • 采用 LLaMA 模型架构,并引入改进,如预归一化、SwiGLU 激活函数与旋转位置编码。
  • 由于许可限制,以相对于原始 LLaMA 权重的参数差异形式发布模型权重,并提供转换脚本。
  • 使用总计 1.4T 标记的七个公开可用数据集混合进行预训练,针对 7B、13B、33B 和 65B 参数版本调整超参数。

实验结果

研究问题

  • RQ1训练数据的数量、质量与语言分布的变化如何影响指令微调中文大语言模型的性能?
  • RQ2开源中文指令跟随型大语言模型之间的相对性能如何?Panda LLM 的表现如何?
  • RQ3两阶段训练方法(预训练 + 指令微调)是否能在中文指令跟随任务上实现更优性能?
  • RQ4在无法访问专有数据或模型的情况下,开源中文大语言模型在多大程度上可实现最先进结果?
  • RQ5如何使开源大语言模型更具透明性、可信度与可定制性,以支持全球使用?

主要发现

  • Panda LLM 在同等参数规模的指令跟随基准测试中,优于所有此前可用的开源中文大语言模型。
  • 两阶段训练方法——即在多样化中文语料上进行预训练,随后进行指令微调——显著提升了模型的指令跟随能力。
  • 该模型在多种指令类型(包括推理、摘要生成与问答)上展现出强大的零样本泛化能力。
  • 评估结果揭示了现有开源中文大语言模型之间存在显著的性能差距,凸显了高质量训练数据与微调的重要性。
  • 通过以相对于 LLaMA 的参数差异形式发布模型权重,实现了用户对原始 LLaMA 权重的完整可重现性与可定制性。
  • 本项目为未来开源、可扩展且多语言的大语言模型奠定了基础,计划发布更大规模的模型,如 Panda-13B 和 Panda-33B。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。