Skip to main content
QUICK REVIEW

[论文解读] When Do You Need Billions of Words of Pretraining Data?

Yian Zhang, Alex Warstadt|arXiv (Cornell University)|Nov 10, 2020
Topic Modeling参考文献 46被引用 16
一句话总结

本文研究了RoBERTa风格语言模型在获取语言特征和下游NLU能力方面,需要多少预训练数据。通过对在100万至10亿词之间预训练的MiniBERTa模型使用四种探针方法,研究发现句法和语义特征在1亿词左右基本已习得,而下游NLU任务的显著性能提升则需要数百亿词——表明常识知识和任务特定知识,而不仅仅是语言结构,是大规模模型性能提升的主要驱动力。

ABSTRACT

NLP is currently dominated by general-purpose pretrained language models like RoBERTa, which achieve strong performance on NLU tasks through pretraining on billions of words. But what exact knowledge or skills do Transformer LMs learn from large-scale pretraining that they cannot learn from less data? We adopt four probing methods---classifier probing, information-theoretic probing, unsupervised relative acceptability judgment, and fine-tuning on NLU tasks---and draw learning curves that track the growth of these different measures of linguistic ability with respect to pretraining data volume using the MiniBERTas, a group of RoBERTa models pretrained on 1M, 10M, 100M and 1B words. We find that LMs require only about 10M or 100M words to learn representations that reliably encode most syntactic and semantic features we test. A much larger quantity of data is needed in order to acquire enough commonsense knowledge and other skills required to master typical downstream NLU tasks. The results suggest that, while the ability to encode linguistic features is almost certainly necessary for language understanding, it is likely that other forms of knowledge are the major drivers of recent improvements in language understanding among large pretrained models.

研究动机与目标

  • 确定语言模型为学习核心语言特征(如句法和语义)所需的最少预训练数据量。
  • 调查大规模预训练(数百亿词)是否对下游NLU任务的高性能是必要的。
  • 区分语言表征学习与其他知识类型(如常识)对大规模模型性能提升的贡献。
  • 评估多种探针方法在不同数据规模下测量语言知识获取的相对有效性。
  • 比较从100万到10亿词不同数据量下的模型性能,包括在约300亿词上预训练的完整规模RoBERTa模型。

提出的方法

  • 在Wikipedia和Smashwords的100万、1000万、1亿和10亿词上训练一系列RoBERTa模型(MiniBERTa),每种规模使用多个随机种子以确保鲁棒性。
  • 应用四种探针方法:(1) 在边缘探针套件上使用分类器探针,以评估可提取的句法和语义特征;(2) 使用最小描述长度(MDL)探针测量特征可访问性;(3) 在BLiMP基准上进行无监督可接受性判断,以评估句法现象;(4) 在五个SuperGLUE任务上进行微调,以评估下游NLU性能。
  • 使用最小-最大归一化将所有探针得分标准化至[0,1]范围,其中0代表性能最差的模型(如随机初始化),1代表性能最佳的模型(如RoBERTa BASE)。
  • 对学习曲线拟合逻辑曲线,以可视化并比较不同数据量下的性能增长。
  • 使用RoBERTa BASE(300亿词)作为高容量基准,用于比较大规模下的性能表现。
  • 综合多种探针方法的结果进行分析,以确保一致性并避免对单一指标的过度依赖。

实验结果

研究问题

  • RQ1RoBERTa模型在何种数据规模下开始可靠地表征核心句法和语义特征?
  • RQ2下游NLU任务(如SuperGLUE)的性能如何随预训练数据量的增加而变化?
  • RQ3在1亿词以上,语言特征(如一致性和绑定)的改善程度如何?
  • RQ4为何模型在NLU任务上的性能提升需要远多于学习语言特征所需的数据量(即数百亿词)?
  • RQ5NLU任务的性能提升是由语言知识驱动,还是由其他知识形式(如常识或世界知识)驱动?

主要发现

  • 在1亿词数据上预训练的模型,在语言探针任务上的表现几乎与在约300亿词上预训练的RoBERTa BASE模型无异。
  • 分类器探针和MDL探针表明,句法和语义特征在1亿词左右已基本习得,此后收益极小。
  • 在BLiMP上的无监督可接受性判断显示,句法知识在1000万词以内迅速提升,1亿词后收益递减。
  • 在SuperGLUE任务上的下游NLU性能仅在预训练数据超过1亿词后才出现显著提升,且在10亿词规模内仍持续增长。
  • 1亿词模型与300亿词模型在SuperGLUE上的性能差距显著,表明常识和任务特定知识的获取所需数据量远超语言结构的获取。
  • 结果表明,尽管语言表征是语言理解的必要条件,但并非充分条件——其他知识类型才是大规模模型性能提升的主要驱动力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。