Skip to main content
QUICK REVIEW

[论文解读] Instruction Tuning with GPT-4

Baolin Peng, Chunyuan Li|arXiv (Cornell University)|Apr 6, 2023
Topic Modeling被引用 186
一句话总结

本文使用 GPT-4 生成 52K 条英文和中文的指令遵循数据,用于微调 LLaMA 模型,取得强的零-shot 指令遵循性能,在未见任务上与 GPT-4 的结果相当,并发布数据和代码。

ABSTRACT

Prior work has shown that finetuning large language models (LLMs) using machine-generated instruction-following data enables such models to achieve remarkable zero-shot capabilities on new tasks, and no human-written instructions are needed. In this paper, we present the first attempt to use GPT-4 to generate instruction-following data for LLM finetuning. Our early experiments on instruction-tuned LLaMA models show that the 52K English and Chinese instruction-following data generated by GPT-4 leads to superior zero-shot performance on new tasks to the instruction-following data generated by previous state-of-the-art models. We also collect feedback and comparison data from GPT-4 to enable a comprehensive evaluation and reward model training. We make our data generated using GPT-4 as well as our codebase publicly available.

研究动机与目标

  • 通过机器生成数据激发开源 LLM 的指令调优。
  • 研究 GPT-4 生成的指令数据是否相较于以往数据提升零-shot 泛化。
  • 探索跨语言(英文/中文)的指令遵循能力。
  • 基于与 GPT-4 的比较开发奖励模型,以引导评估和解码。
  • 向研究社区提供公开可用的 GPT-4 生成数据和调优流水线。

提出的方法

  • 使用 GPT-4 为 52K 条 Alpaca 指令生成英文指令遵循数据(每条指令一个回应)。
  • 通过 ChatGPT 将指令翻译成中文并用中文回答,以创建中文指令遵循数据。
  • 让 GPT-4 对模型输出进行评分并比较,建立对奖励模型的训练数据。
  • 在 GPT-4 生成的数据上训练 LLaMA-7B 模型,得到 LLaMA-GPT4 和 LLaMA-GPT4-CN。
  • 使用三种评估设置:人类对齐(HHH 标准)、基于 GPT-4 的自动评估,以及对 Unnatural Instructions 的 ROUGE-L。
  • 公开 GPT-4 生成的数据以及微调后的模型检查点和代码库。

实验结果

研究问题

  • RQ1GPT-4 生成的指令数据是否相较于先前数据源提高了对未见任务的零-shot 泛化?
  • RQ2用 GPT-4 数据进行指令调优是否能在未见指令上达到接近 GPT-4 的性能?
  • RQ3跨语言(英文对中文)的指令遵循在开源 LLMs 上的泛化能力如何?
  • RQ4由 GPT-4 驱动的奖励模型是否能有效引导对指令遵循输出的评估和解码?
  • RQ5在该流程中,数据规模、模型大小和 RLHF 整合的实际考虑因素有哪些?

主要发现

  • GPT-4 生成的指令数据在未见任务上的零-shot 性能优于基于 GPT-3.5 的数据。
  • LLaMA-GPT4 (7B) 在对强模型如 ChatGPT 和 GPT-4 的自动评估中,常常优于 13B 的 Alpaca 和 LLaMA 基线。
  • GPT-4 指令调优的 LLaMA 在跨人类评估的对齐标准上与 GPT-4 接近,表明在某些任务中 GPT-4 数据可以媲美教师模型。
  • 跨语言结果显示来自 GPT-4 的中文指令遵循数据能够使中文模型有效,并支持跨语言泛化分析。
  • 基于 GPT-4 的奖励建模为解码和评估提供一致的排序信号,与人类和 GPT-4 的反馈保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。