Skip to main content
QUICK REVIEW

[论文解读] Should You Mask 15% in Masked Language Modeling?

Alexander Wettig, Tianyu Gao|arXiv (Cornell University)|Feb 16, 2022
Natural Language Processing Techniques被引用 7
一句话总结

本文挑战了掩码语言建模(MLM)中普遍采用的15%掩码率,表明更高的掩码率(最高可达80%)可在保持GLUE和SQuAD下游微调性能95%的同时,提升样本效率。作者表明,更大的模型从更高的掩码率中获益更多,且预测率(被预测的标记数量)与破坏率(被掩码的标记比例)具有相反的影响,他们通过解耦分析重新评估了BERT的80-10-10策略。

ABSTRACT

Masked language models (MLMs) conventionally mask 15% of tokens due to the belief that more masking would leave insufficient context to learn good representations; this masking rate has been widely used, regardless of model sizes or masking strategies. In this work, we revisit this important choice of MLM pre-training. We first establish that 15% is not universally optimal, and larger models should adopt a higher masking rate. Specifically, we find that masking 40% outperforms 15% for BERT-large size models on GLUE and SQuAD. Interestingly, an extremely high masking rate of 80% can still preserve 95% fine-tuning performance and most of the accuracy in linguistic probing, challenging the conventional wisdom about the role of the masking rate. We then examine the interplay between masking rates and masking strategies and find that uniform masking requires a higher masking rate compared to sophisticated masking strategies such as span or PMI masking. Finally, we argue that increasing the masking rate has two distinct effects: it leads to more corruption, which makes the prediction task more difficult; it also enables more predictions, which benefits optimization. Using this framework, we revisit BERT's 80-10-10 corruption strategy. Together, our results contribute to a better understanding of MLM pre-training.

研究动机与目标

  • 调查MLM中广泛采用的15%掩码率是否在不同模型尺寸和掩码策略下均最优。
  • 理解掩码率如何与模型大小、掩码策略及优化效率相互作用。
  • 解耦MLM预训练中破坏率(被掩码的比例)与预测率(被预测的标记数量)的影响。
  • 通过一种能分离破坏与预测效应的新框架,重新评估BERT的80-10-10破坏策略。
  • 为更高掩码率作为实现更高效样本预训练的路径提供证据,尤其适用于大模型。

提出的方法

  • 作者使用高效训练方案,对BERT-large模型分别以15%、40%和80%的掩码率进行预训练,并在GLUE和SQuAD上进行评估。
  • 他们在不同掩码率下比较均匀掩码、跨度掩码和基于PMI的掩码策略,以评估策略依赖的最优掩码率。
  • 他们提出一种解耦分析框架,将破坏率(被掩码标记的比例)与预测率(被预测的标记数量)分离,实现独立消融。
  • 他们开展消融实验,以隔离增加破坏率(上下文损失)与增加预测率(更多训练信号)的影响。
  • 他们重新评估BERT的80-10-10策略(80%被掩码,10%为原始,10%为随机),发现其性能低于预测率更高的替代策略。
  • 他们采用一致的预训练方案,并在标准基准上报告结果,包括困惑度、下游准确率和语言学探针结果。

实验结果

研究问题

  • RQ115%的掩码率是否在掩码语言模型预训练中普遍最优,还是取决于模型大小?
  • RQ2不同掩码策略(均匀、跨度、PMI)如何与掩码率相互作用,其最优掩码率是什么?
  • RQ3在MLM预训练中,破坏率(上下文损失)与预测率(训练信号)的独立影响分别是什么?
  • RQ4当与预测率更高的替代策略相比时,BERT的80-10-10破坏策略是否仍为最优?
  • RQ5极高掩码率(如80%)是否仍能为下游任务生成有效表示?

主要发现

  • 对于BERT-large模型,40%的掩码率在GLUE和SQuAD上的表现优于15%,MNLI得分提升+0.3,SQuAD F1提升+1.8。
  • 在80%掩码率下,模型在下游任务上的微调性能仍保持15%掩码率的95%,尽管困惑度达到1141.4。
  • 语言学探针显示,即使在80%掩码的模型中,其语言表征能力依然很强。
  • 均匀掩码从更高掩码率中获益更多,而像跨度掩码或PMI掩码等复杂策略对较低掩码率更具鲁棒性。
  • 解耦分析证实,更高的预测率可改善优化,而更高的破坏率则损害性能,表明掩码率具有相反的影响。
  • 与预测率更高的替代策略相比,BERT的80-10-10策略表现较差,表明其并非最优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。