Skip to main content
QUICK REVIEW

[论文解读] The Turking Test: Can Language Models Understand Instructions?

Avia Efrat, Omer Levy|arXiv (Cornell University)|Oct 22, 2020
Topic Modeling参考文献 8被引用 10
一句话总结

本文提出了Turking测试,一项用于评估大型语言模型是否能够理解并遵循自然语言指令的基准。尽管评估标准宽松且经过多次指令优化,GPT-2在检索第n个词的任务上仅达到2%的准确率,在检索第n个字符的任务上仅达到1.3%,表明其在简单任务上也表现出极差的指令遵循能力。

ABSTRACT

Supervised machine learning provides the learner with a set of input-output examples of the target task. Humans, however, can also learn to perform new tasks from instructions in natural language. Can machines learn to understand instructions as well? We present the Turking Test, which examines a model's ability to follow natural language instructions of varying complexity. These range from simple tasks, like retrieving the nth word of a sentence, to ones that require creativity, such as generating examples for SNLI and SQuAD in place of human intelligence workers ("turkers"). Despite our lenient evaluation methodology, we observe that a large pretrained language model performs poorly across all tasks. Analyzing the model's error patterns reveals that the model tends to ignore explicit instructions and often generates outputs that cannot be construed as an attempt to solve the task. While it is not yet clear whether instruction understanding can be captured by traditional language models, the sheer expressivity of instruction understanding makes it an appealing alternative to the rising few-shot inference paradigm.

研究动机与目标

  • 探究大型语言模型是否能够理解并遵循自然语言指令,而非仅依赖输入-输出示例。
  • 评估基于指令的学习在自然语言处理中作为少样本提示的替代方案的可行性。
  • 评估语言模型在解释指令中明确约束和条件时的鲁棒性。
  • 探索指令理解是否可作为比少样本学习更具表现力和泛化能力的范式。
  • 识别模型在面对清晰、结构化的指令时行为失败的模式。

提出的方法

  • 提出Turking测试,一套基准测试套件,用于在三种任务类型上测试指令遵循能力:数据集标注(SNLI、SQuAD、NewsQA)、在条件下的名词列举,以及按索引检索元素。
  • 所有实验均使用Hugging Face实现的GPT-2(1.5B参数),采用贪婪解码和核采样(p=0.9)两种方式。
  • 通过人工反馈进行迭代式指令优化,以提升清晰度和性能,并在事后选择表现最佳的指令版本。
  • 采用宽松的评估策略,对复杂任务进行人工手动评估,对简单任务则使用自动化检查。
  • 每轮生成最多使用|x|+20个标记,遇到结束符(EOS)时提前停止,且仅评估贪婪解码,因为核采样导致性能持续下降。
  • 在GLUE诊断数据集的832个句子上进行评估,词的索引上限为20,字符的索引上限为40。

实验结果

研究问题

  • RQ1大型语言模型(如GPT-2)是否能在任务复杂度逐步提升的情况下,理解并正确遵循自然语言指令?
  • RQ2在基础任务上,指令遵循性能与简单基线(如最常见词或最常见字符)相比如何?
  • RQ3模型在指令中明确陈述的约束和条件,即使表达清晰,有多大程度上会被忽略?
  • RQ4模型输出中的重复模式如何反映其对指令的理解错误或解析失败?
  • RQ5指令范式是否可被视为少样本范式的严格泛化?其优势体现在哪些方面?

主要发现

  • 在从句子中检索第n个词的任务中,GPT-2的准确率仅为2.0%,远低于最常见词('the')生成基线的6.4%。
  • 在检索第n个字符的任务中,模型准确率为1.3%,远低于最常见字符('e')生成基线的13.8%。
  • 在46%的第n个词输出和59%的第n个字符输出中,模型重复了输入句子或指令,且这些情况始终导致错误答案。
  • 模型对指令措辞表现出过度敏感:即使指令几乎相同,词任务和字符任务的重复模式也存在显著差异。
  • 模型在具有单一正确答案的明确定义任务上的表现,反而劣于在开放式任务上的表现,表明其在处理明确约束时存在困难。
  • 尽管经过多次指令优化和宽松评估,模型仍无法理解最简单的指令,表明其在指令理解方面存在根本性局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。