Skip to main content
QUICK REVIEW

[论文解读] Large-scale Cloze Test Dataset Created by Teachers

Qizhe Xie, Guokun Lai|arXiv (Cornell University)|Nov 9, 2017
Natural Language Processing Techniques参考文献 40被引用 4
一句话总结

本文提出了CLOTH,一个由中小学教师创建的大规模完形填空数据集,用于评估语言理解能力。与自动生成的数据集不同,CLOTH包含精心设计的空格和语义细微的候选选项,能够测试词汇、语法和推理能力,要求更深层次的理解和更长的上下文建模。主要发现是,当前最先进语言模型在该数据集上的表现显著落后于人类,主要原因是长上下文理解能力有限,证实CLOTH为NLP系统提供了一个具有挑战性的基准。

ABSTRACT

Cloze tests are widely adopted in language exams to evaluate students' language proficiency. In this paper, we propose the first large-scale human-created cloze test dataset CLOTH, containing questions used in middle-school and high-school language exams. With missing blanks carefully created by teachers and candidate choices purposely designed to be nuanced, CLOTH requires a deeper language understanding and a wider attention span than previously automatically-generated cloze datasets. We test the performance of dedicatedly designed baseline models including a language model trained on the One Billion Word Corpus and show humans outperform them by a significant margin. We investigate the source of the performance gap, trace model deficiencies to some distinct properties of CLOTH, and identify the limited ability of comprehending the long-term context to be the key bottleneck.

研究动机与目标

  • 为解决自动生成完形填空数据集的局限性,这些数据集常因随机选择空格和候选生成不佳而导致问题过于简单或模糊。
  • 创建一个大规模、人工筛选的完形填空数据集,反映真实的教育评估场景,并测试更深层次的语言理解能力。
  • 探究当前最先进语言模型在人类设计的完形填空题目上表现不如人类的原因。
  • 识别在完形填空式阅读理解任务中,模型与人类之间性能差距的根本原因。
  • 为评估语言模型和机器理解系统在长上下文建模方面的能力提供一个稳健的基准。

提出的方法

  • CLOTH源自真实的中学和高中英语考试,空格由教师设计,用于测试特定语言现象,如词汇、语法和推理能力。
  • 每个完形填空题目包含一段上下文段落、一个带空格的句子,以及四个候选选项——三个干扰项和一个正确答案——这些选项经过精心挑选,确保语法正确且语义细微。
  • 数据集被划分为三个子集:CLOTH(完整版)、CLOTH-M(中等难度)和CLOTH-H(高难度),以评估模型在不同难度水平下的表现。
  • 提出一种基于代表性加权的平均方法,通过根据候选答案与上下文的语义相关性来加权预测结果,以提升模型性能。
  • 作者在One Billion Word语料库上训练并评估了一个语言模型,并将其在CLOTH上的表现与人工标注者进行比较,通过消融研究隔离外部数据和代表性特征的影响。
  • 通过错误分析和在受限上下文条件(如单句上下文)下的人工评估,验证了长上下文建模是主要瓶颈的假设。

实验结果

研究问题

  • RQ1为何当前最先进语言模型在人类设计的完形填空测试中表现不如人类?
  • RQ2CLOTH的哪些特定语言特性使其比自动生成的完形填空数据集更具挑战性?
  • RQ3无法建模长距离依赖在多大程度上导致了模型与人类在CLOTH上的性能差距?
  • RQ4基于代表性的平均方法在提升CLOTH上模型预测性能方面有多有效?
  • RQ5人类设计的完形填空题目是否能作为评估深层语言理解能力的更可靠基准,相比自动生成的题目?

主要发现

  • 人类在CLOTH上的表现显著优于最佳语言模型(1B-LM),在完整数据集上性能差距约为10%。
  • 性能差距主要归因于模型在理解长期上下文方面的有限能力,这一点在人类被限制为单句上下文时也观察到相似的性能下降。
  • 消融研究显示,若移除代表性信息,准确率从0.583降至0.566;若完全移除人工创建的数据,准确率降至0.543,接近基线语言模型的水平。
  • 模型在自动生成的完形填空数据集上的表现远优于在CLOTH上的表现,证实人类设计的问题更具挑战性,需要更深层次的理解。
  • 基于代表性的平均方法优于基线模型,表明在候选选项选择中引入语义相关性具有显著价值。
  • 模型在测试集上的F1得分为36.5,表明每段文本可生成多个合理的问题,凸显了该数据集的复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。