Skip to main content
QUICK REVIEW

[论文解读] Natural Instructions: Benchmarking Generalization to New Tasks from Natural Language Instructions

Swaroop Mishra, Daniel Khashabi|arXiv (Cornell University)|Apr 18, 2021
Topic Modeling参考文献 33被引用 32
一句话总结

本文提出了 NATURAL INSTRUCTIONS,一个包含 600,000 个任务实例和 61 种自然语言指令的基准,用于评估自然语言处理模型通过少样本提示或微调在新任务上的泛化能力。结果表明,尽管 GPT-3 和 BART 等模型在指令指导下性能有所提升,但泛化能力仍受限,尤其是在不同指令领域之间,表明在指令遵循的泛化能力方面仍有巨大改进空间。

ABSTRACT

Can we enable NLP models to appropriately respond to instructional prompts and consequently generalize to new tasks? To study this question, we leverage the existing NLP datasets and the instructions that were used to crowdsource them to create NATURAL INSTRUCTIONS, a dataset of instructions and task-specific input/output data. This dataset consists of 61 distinct language instructions and about 600k task instances, and is used to evaluate existing state-of-the-art language-models (LMs) in addressing new tasks by few-shot prompting of GPT3 and fine-tuning BART. Our analysis indicates that: (a) the existing models indeed benefit from instructions and hence, show improved generalization to new tasks; (b) while models like GPT-3 generally benefit from instructions, the extent of their gains varies across different fields of instructions and also depends on the task being solved; (c) generalization to unseen tasks in NATURAL INSTRUCTIONS remains far from perfect for the state-of-the-art, indicating significant room for more progress in this direction.

研究动机与目标

  • 探究语言模型在接收到自然语言指令时,能否在新任务上实现泛化。
  • 构建一个大规模、多样化的指令-任务对基准,以评估跨领域的指令泛化能力。
  • 评估最先进的模型(如 GPT-3 和 BART)在未见任务上使用少样本提示和微调的性能表现。
  • 分析指令类型和任务领域对模型泛化性能的影响。
  • 识别当前模型在指令微调后仍难以泛化到新任务的缺陷。

提出的方法

  • 利用现有的自然语言处理数据集及其原始众包指令,构建了包含 61 种不同语言指令和约 600,000 个输入-输出任务实例的 NATURAL INSTRUCTIONS 数据集。
  • 使用该数据集评估 GPT-3 的少样本提示和 BART 的微调在零样本泛化到新任务上的表现。
  • 将指令分类到不同领域(如文本分类、序列标注等),以分析不同领域间的性能差异。
  • 在训练期间未见过的未见任务实例上,使用标准自然语言处理指标评估模型性能。
  • 对比不同指令类型和任务类型下的泛化性能,以识别模型行为的模式。

实验结果

研究问题

  • RQ1语言模型在泛化到新任务时,从自然语言指令中受益的程度如何?
  • RQ2指令类型和任务领域如何影响自然语言处理模型的泛化性能?
  • RQ3在 NATURAL INSTRUCTIONS 中,GPT-3 的少样本提示与 BART 的微调在泛化到未见任务上的表现如何比较?
  • RQ4尽管经过指令微调,当前模型在泛化到新任务方面仍存在哪些局限性?
  • RQ5是否存在某些指令领域,其泛化能力始终较弱或较强?

主要发现

  • 如 GPT-3 这类语言模型在获得自然语言指令后,泛化能力有可测量的提升,证实了指令微调的价值。
  • 指令带来的性能增益在不同指令领域和任务类型之间存在显著差异,表明其有效性具有领域依赖性。
  • 尽管有所提升,NATURAL INSTRUCTIONS 中对未见任务的泛化能力仍远未达到最优,凸显了当前模型能力中的关键差距。
  • 在指令-任务对上微调 BART 的性能优于少样本提示,但跨多样化指令类型的泛化能力仍受限。
  • 模型在不同指令领域间表现出不一致的性能,表明指令多样性与任务复杂性是泛化面临的关键挑战。
  • 结果表明,尽管指令遵循提升了泛化能力,但要在所有任务上实现稳健的零样本或少样本泛化,仍是开放性挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。