Skip to main content
QUICK REVIEW

[论文解读] Towards Better Instruction Following Language Models for Chinese: Investigating the Impact of Training Data and Evaluation

Yunjie Ji, Yan Gong|arXiv (Cornell University)|Apr 16, 2023
Topic Modeling被引用 4
一句话总结

本文研究了训练数据的数量、质量以及语言分布对中国语言模型指令遵循能力的影响。通过扩展 LLaMA 的词表并基于精心筛选的指令数据集中的 34 亿个中文词进行微调,作者在保持强大性能的同时,将训练和推理时间减少了 60%,并公开发布了其模型、数据和代码,以推动开源中文对话人工智能的发展。

ABSTRACT

Recently, significant public efforts have been directed towards developing low-cost models with capabilities akin to ChatGPT, thereby fostering the growth of open-source conversational models. However, there remains a scarcity of comprehensive and in-depth evaluations of these models' performance. In this study, we examine the influence of training data factors, including quantity, quality, and linguistic distribution, on model performance. Our analysis is grounded in several publicly accessible, high-quality instruction datasets, as well as our own Chinese multi-turn conversations. We assess various models using a evaluation set of 1,000 samples, encompassing nine real-world scenarios. Our goal is to supplement manual evaluations with quantitative analyses, offering valuable insights for the continued advancement of open-source chat models. Furthermore, to enhance the performance and training and inference efficiency of models in the Chinese domain, we extend the vocabulary of LLaMA - the model with the closest open-source performance to proprietary language models like GPT-3 - and conduct secondary pre-training on 3.4B Chinese words. We make our model, data, as well as code publicly available.

研究动机与目标

  • 研究训练数据因素(数量、质量、语言分布)对中国语言模型指令遵循能力的影响。
  • 构建一个包含 1,000 个中文指令样本的全面、多样且平衡的评估集,覆盖九种真实场景,以实现模型的定量比较。
  • 通过词表扩展和二次预训练,提升基于 LLaMA 的模型在中文语言领域的效率与性能。
  • 通过提供公开可用的基准测试和模型,弥补开源中文大模型开发中系统性、大规模评估的不足。
  • 通过在开源许可证下发布训练好的模型、训练数据和代码,促进可复现性与社区发展。

提出的方法

  • 扩展 LLaMA 词表,纳入中文子词单元和领域特定标记,以提升中文语言建模效率。
  • 在公开获取的高质量指令数据集(包括自定义多轮中文对话)中,基于 34 亿个中文词进行二次预训练。
  • 使用全参数微调方法,在 Alpaca 风格、ShareGPT 和 Belle-3.5 数据集等指令数据组合上微调扩展后的 LLaMA 模型。
  • 构建一个涵盖九种真实用户场景的 1,000 个样本评估集,用于评估模型在多样化指令类型下的表现。
  • 结合自动评估(GPT-4 评分)与人工评估,验证模型输出质量与一致性,并进行分析。
  • 推理过程中使用较低温度(0.001)以减少重复,同时开展温度超参数的消融实验,评估其对响应多样性的影响。

实验结果

研究问题

  • RQ1训练数据的数量与质量变化如何影响中文大语言模型的指令遵循能力?
  • RQ2训练数据中的语言分布与领域多样性对模型在真实场景中泛化能力有何影响?
  • RQ3通过扩展 LLaMA 词表并在中文语料上进行预训练,能在多大程度上提升模型在中文任务中的效率与性能?
  • RQ4开源中文指令遵循模型与 ChatGPT 等专有模型相比,其泛化能力如何?其主要失败模式是什么?
  • RQ5一个平衡且多样的 1,000 个样本评估集能否提供可靠且有意义的模型性能比较?

主要发现

  • 扩展 LLaMA 词表并在 34 亿个中文词上进行预训练,使训练与推理时间减少 60%,且未影响性能。
  • 在 Alpaca、ShareGPT 和 Belle-3.5 指令数据组合上微调的模型,在多样化指令类型下表现良好,但并非所有情况下均能与 GPT-4 比肩。
  • 模型输出倾向于更长、更冗长,可能由于训练中包含了 GPT-4 生成或多轮对话数据所致。
  • 尽管评估集得分较高,但案例分析揭示了指标表现与真实用户使用体验之间存在脱节,表明评估集的全面性仍有限。
  • 将生成温度从 0.001 提升至 0.5 显著提高了响应多样性,表明低温度设置可能导致重复输出。
  • 评估集虽具多样性,但覆盖面仍不足——过于简单或过于困难的样本可能扭曲性能比较结果,凸显了构建更平衡、更大规模基准测试的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。