Skip to main content
QUICK REVIEW

[论文解读] Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor

Or Honovich, Thomas Scialom|arXiv (Cornell University)|Dec 19, 2022
Topic Modeling被引用 5
一句话总结

本文提出了Unnatural Instructions,一个包含240,670个样本的自然语言指令数据集,该数据集通过仅使用15个种子样本的预训练语言模型自动生成指令、输入和输出。尽管数据中包含噪声,但在该数据集上微调11B参数的T5模型,在多个基准测试中表现优于T0++和Tk-Instruct等人工精心筛选的数据集,证明了模型生成的数据在质量与多样性方面可媲美人工标注数据,同时大幅降低人力成本。

ABSTRACT

Instruction tuning enables pretrained language models to perform new tasks from inference-time natural language descriptions. These approaches rely on vast amounts of human supervision in the form of crowdsourced datasets or user interactions. In this work, we introduce Unnatural Instructions: a large dataset of creative and diverse instructions, collected with virtually no human labor. We collect 64,000 examples by prompting a language model with three seed examples of instructions and eliciting a fourth. This set is then expanded by prompting the model to rephrase each instruction, creating a total of approximately 240,000 examples of instructions, inputs, and outputs. Experiments show that despite containing a fair amount of noise, training on Unnatural Instructions rivals the effectiveness of training on open-source manually-curated datasets, surpassing the performance of models such as T0++ and Tk-Instruct across various benchmarks. These results demonstrate the potential of model-generated data as a cost-effective alternative to crowdsourcing for dataset expansion and diversification.

研究动机与目标

  • 开发一种可扩展、低人力投入的多样化、高质量指令微调数据集生成方法。
  • 探究语言模型生成的数据是否能与人工精心筛选的指令数据集表现相当或更优。
  • 探索在无任何人工监督的情况下,使用模型生成的指令进行通用指令微调的可行性。
  • 评估数据多样性与创造力对下游模型在分布外任务上泛化能力的影响。

提出的方法

  • 作者使用预训练语言模型,通过在Super-Natural Instructions中选取三组种子样本进行提示,生成64,000个指令-输入-输出三元组,共使用五组不同的种子集。
  • 采用两步生成流程:首先生成指令和输入,然后通过确定性方式生成输出以最大化准确性。
  • 为提升多样性,使用同一模型对每条指令进行改写,保持输入和输出内容不变,仅改变表达方式。
  • 通过迭代式改写将数据集扩展至约240,000个样本,整个过程几乎无需人工参与。
  • 通过在Unnatural Instructions上微调11B参数的T5模型,并与在T0++和Tk-Instruct上微调的模型在多个基准上进行比较,评估性能。
  • 消融实验对比了一步法(统一)与两步法(分离)生成策略,结果表明确定性输出生成能提升性能。

实验结果

研究问题

  • RQ1语言模型能否在极少人工干预下生成多样化且高质量的指令微调数据集?
  • RQ2在下游任务性能方面,基于模型生成数据训练的模型是否优于基于人工精心筛选指令数据集训练的模型?
  • RQ3模型生成的指令在多样性和创造性方面与人工标注数据相比如何?
  • RQ4数据生成策略(如一步法与两步法)对模型性能有何影响?
  • RQ5模型生成的数据能否提升模型在标准基准未覆盖的分布外任务上的泛化能力?

主要发现

  • 在Unnatural Instructions上微调11B参数的T5模型,相较于基线模型,在BIG-bench Hard基准上实现了18分的性能提升。
  • 在LMentry基准上,该模型实现了16分的性能增益,表明其在非传统自然语言处理任务上具有强大的泛化能力。
  • 尽管数据中存在噪声,但超过50%的生成样本是正确的,即使错误样本也常包含对指令微调有用的有用信息。
  • 在Super-Natural Instructions验证集上,两步生成流程(分离生成输入与输出)比一步统一生成流程高出1.7分。
  • 与Super-Natural Instructions相比,该数据集在任务类型和表达方式多样性方面显著更高,包含大量创造性和非标准的自然语言处理任务。
  • 性能随数据集规模呈对数线性增长,表明通过进一步扩大模型生成数据的规模,仍有进一步提升空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。