Skip to main content
QUICK REVIEW

[论文解读] Instruction Induction: From Few Examples to Natural Language Task Descriptions

Or Honovich, Uri Shaham|arXiv (Cornell University)|May 22, 2022
Topic Modeling被引用 6
一句话总结

本文提出指令归纳(instruction induction)这一新范式,即大型语言模型从少量输入-输出示例中生成自然语言指令,从而在无需微调的情况下实现零样本任务描述。表现最佳的模型 InstructGPT 在执行准确率上达到 43.6%,相当于人类性能的 43.6%,表明指令归纳是一种可行且可解释的学习范式,具有显著降低虚假相关性并提升模型透明度的潜力。

ABSTRACT

Large language models are able to perform a task by conditioning on a few input-output demonstrations - a paradigm known as in-context learning. We show that language models can explicitly infer an underlying task from a few demonstrations by prompting them to generate a natural language instruction that fits the examples. To explore this ability, we introduce the instruction induction challenge, compile a dataset consisting of 24 tasks, and define a novel evaluation metric based on executing the generated instruction. We discover that, to a large extent, the ability to generate instructions does indeed emerge when using a model that is both large enough and aligned to follow instructions; InstructGPT achieves 65.7% of human performance in our execution-based metric, while the original GPT-3 model reaches only 9.8% of human performance. This surprising result suggests that instruction induction might be a viable learning paradigm in and of itself, where instead of fitting a set of latent continuous parameters to the data, one searches for the best description in the natural language hypothesis space.

研究动机与目标

  • 探究大型语言模型是否能够通过自然语言显式推断并描述少量示例中的潜在任务关系。
  • 探索指令归纳作为基于参数学习的潜在替代方案,其以自然语言为基础,旨在提升可解释性。
  • 评估语言模型在无需微调或标注指令数据的情况下,生成准确且可执行指令的能力。
  • 通过语义相似度(BERTScore)和执行准确率,对比指令归纳模型与人工编写的指令的性能表现。
  • 确定指令归纳出现的条件,特别是模型规模和指令微调的影响。

提出的方法

  • 将指令归纳建模为零样本提示任务:给定少量输入-输出对,生成描述任务的自然语言指令。
  • 使用一种旨在激发指令生成的元提示(meta-prompt),其设计灵感来自人类解谜行为,无需微调即可提示模型。
  • 构建一个包含 24 种多样化自然语言处理任务的基准数据集,涵盖词形句法、风格迁移和情感分析等任务。
  • 采用两种指标评估生成的指令:使用 BERTScore 衡量与人类参考文本的语义相似度,使用执行准确率衡量功能正确性。
  • 通过测试第二个语言模型是否仅凭生成的指令而无需示例即可完成任务,来衡量执行准确率。
  • 对较小模型和原始 GPT-3 进行消融研究,以分离模型规模和指令微调在实现指令归纳中的作用。

实验结果

研究问题

  • RQ1大型语言模型能否在少样本设置下,生成准确描述输入-输出对之间关系的自然语言指令?
  • RQ2指令归纳在多样化自然语言处理任务中的表现如何变化?哪些任务最适用于该范式?
  • RQ3模型规模和指令微调在多大程度上影响模型执行指令归纳的能力?
  • RQ4与 BERTScore 等语义相似度指标相比,执行准确率在评估指令质量方面表现如何?
  • RQ5指令归纳能否作为传统基于参数学习的可行替代方案,特别是在降低虚假相关性和提升可解释性方面?

主要发现

  • InstructGPT 在指令归纳基准上的执行准确率达到 43.6%,相当于人类性能的 65.7%,表明其在生成可执行指令方面具备强大的功能正确性。
  • 原始 GPT-3 模型在执行准确率指标上仅达到人类性能的 9.8%,表明在无指令微调的情况下缺乏指令归纳能力。
  • InstructGPT 的 BERTScore 为 44.4,而人类表现为 60.0,表明生成的指令在语义上接近人类参考,但尚未达到同等水平。
  • 在某些任务中,如正式风格迁移和语义文本相似性任务,InstructGPT 生成的指令在功能上正确且达到人类水平,例如使用 "将输入内容翻译为更正式的语言" 等表达。
  • 指令归纳对模型架构和微调高度依赖:较小的 InstructGPT 变体和原始 GPT-3 均无法生成有意义的指令,表明指令微调和模型规模至关重要。
  • 通用或空洞的指令如 "为每个输入编写一个输出" 虽能提高 BERTScore,但在执行准确率上表现失败,凸显了执行准确率作为更优评估指标的稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。