[论文解读] Masked Language Modeling and the Distributional Hypothesis: Order Word Matters Pre-training for Little
本文研究掩码语言模型(MLMs)的成功是否主要源于学习词共现的分布统计特性,而非句法结构。通过在保持词汇和词频不变的前提下,对 RoBERTa 模型进行随机排列句子的预训练,作者发现,即使在对词序敏感的任务上,模型在 GLUE 和 PAWS 基准测试中仍能取得优异的下游性能,表明仅靠分布先验即可解释 MLM 成功的大部分原因。
A possible explanation for the impressive performance of masked language model (MLM) pre-training is that such models have learned to represent the syntactic structures prevalent in classical NLP pipelines. In this paper, we propose a different explanation: MLMs succeed on downstream tasks almost entirely due to their ability to model higher-order word co-occurrence statistics. To demonstrate this, we pre-train MLMs on sentences with randomly shuffled word order, and show that these models still achieve high accuracy after fine-tuning on many downstream tasks -- including on tasks specifically designed to be challenging for models that ignore word order. Our models perform surprisingly well according to some parametric syntactic probes, indicating possible deficiencies in how we test representations for syntactic information. Overall, our results show that purely distributional information largely explains the success of pre-training, and underscore the importance of curating challenging evaluation datasets that require deeper linguistic knowledge.
研究动机与目标
- 测试掩码语言模型(MLMs)在下游性能中是否更依赖于词共现的分布统计特性,而非句法结构。
- 评估在预训练过程中去除词序对模型泛化能力和语言能力的影响。
- 评估当前评估基准是否真正测试了句法理解能力,还是对分布统计模式存在偏差。
- 探究非参数句法探针(显示性能下降)与参数句法探针(显示强性能)在排列模型上的差异。
提出的方法
- 在大规模语料上对 RoBERTa 模型进行预训练,其中词序被随机排列,同时保持词汇和一元语法频率不变。
- 训练时不使用位置嵌入,以实现完全的顺序无关性。
- 在原始语料的词频分布上采样数据进行训练,以隔离分布统计特性。
- 使用标准微调超参数,将在所有排列数据上预训练的模型在标准下游 NLP 任务(如 GLUE、PAWS)上进行微调。
- 使用标准基准评估性能:RTE、MRPC、SST-2、CoLA、QQP、QNLI、MNLI 和 PAWS。
- 应用非参数和参数句法探针方法,以评估句法表征质量。
实验结果
研究问题
- RQ1在无词序信息的随机排列句子上进行预训练,模型在下游 NLP 任务上仍能取得多高程度的性能?
- RQ2与标准模型相比,排列后的 MLM 模型在句法探针任务上的表现如何?
- RQ3为何参数句法探针在排列模型上仍表现出强性能,尽管这些模型缺乏对词序的感知?
- RQ4当前的评估基准是否真正需要组合性或句法理解能力,还是对分布统计模式存在偏差?
- RQ5仅靠分布统计特性是否足以解释现代预训练语言模型的成功?
主要发现
- 在随机排列句子上进行预训练的 MLM 模型在 GLUE 基准上达到 85.6% 的平均得分,接近标准 RoBERTa 模型的 87.3%,表明在无词序信息下仍具备强大性能。
- 即使在对句法结构敏感的任务(如 CoLA 和 MNLI)上,排列模型的准确率也分别达到 82.1% 和 85.4%,仅比标准模型低 2-4%。
- 非参数句法探针确认,排列模型在句法依赖任务上的表现显著更差,表明其已丧失显式的句法知识。
- 参数句法探针显示,排列模型在句法探针任务上的性能达到标准模型的 88.7%,表明当前句法理解评估方法可能存在缺陷。
- 在仅基于一元语法采样数据(无句子级结构)上训练的模型,仍达到 78.9% 的平均 GLUE 得分,表明仅靠分布统计特性即可实现强大的下游性能。
- 结果表明,当前评估基准可能更偏向于分布统计模式,而非真正要求句法泛化能力,因此需要设计更具挑战性的数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。