Skip to main content
QUICK REVIEW

[论文解读] PMI-Masking: Principled masking of correlated spans

Yoav Levine, Barak Lenz|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 24被引用 14
一句话总结

该论文提出PMI-Masking,一种基于点互信息(PMI)识别高共现n-gram的系统性方法,用于在预训练掩码语言模型(MLMs)中对相关词段进行掩码。通过联合掩码这些语义连贯的词段而非随机标记,PMI-Masking显著加速了收敛——在训练时间减半的情况下达到先前方法在训练结束时的性能水平,同时在多个基准测试(包括RACE和SQuAD2.0)上提升了下游任务表现。

ABSTRACT

Masking tokens uniformly at random constitutes a common flaw in the pretraining of Masked Language Models (MLMs) such as BERT. We show that such uniform masking allows an MLM to minimize its training objective by latching onto shallow local signals, leading to pretraining inefficiency and suboptimal downstream performance. To address this flaw, we propose PMI-Masking, a principled masking strategy based on the concept of Pointwise Mutual Information (PMI), which jointly masks a token n-gram if it exhibits high collocation over the corpus. PMI-Masking motivates, unifies, and improves upon prior more heuristic approaches that attempt to address the drawback of random uniform token masking, such as whole-word masking, entity/phrase masking, and random-span masking. Specifically, we show experimentally that PMI-Masking reaches the performance of prior masking approaches in half the training time, and consistently improves performance at the end of training.

研究动机与目标

  • 解决MLM中随机标记掩码的低效问题,该方法易过度拟合到简单的子词预测任务,且对完整词语理解的训练不足。
  • 克服全词掩码和随机跨度掩码等启发式掩码策略的局限性,前者范围受限,后者包含噪声且不完整的共现词组。
  • 开发一种基于统计共现的系统性、数据驱动的掩码策略,以提升信号效率和模型泛化能力。
  • 证明PMI-Masking相较于随机标记和随机跨度掩码,能实现更快收敛并取得更优的下游性能。
  • 重新审视标准MLM目标(单标记预测)与下游性能相关性差的问题,并提出更有效的替代方案。

提出的方法

  • 定义扩展的n元点互信息(PMI)度量,用于识别预训练语料库中高共现n-gram(如短语、共现词组)。
  • 利用扩展PMI公式识别语料库中在统计上显著共现(超出单个词频)的所有n-gram。
  • 将每个高PMI n-gram视为单一掩码单元,而未参与任何此类单元的标准词符则保持独立可掩码。
  • 在预训练过程中,随机选择掩码高PMI n-gram或单个词符,确保语义连贯词段的联合掩码。
  • 使用标准MLM目标从剩余上下文中预测被掩码的词段(n-gram或单个词符),且无需对BERT架构进行任何修改。
  • 使用与基线方法相同的超参数和序列长度训练模型,确保不同掩码策略之间的公平比较。

实验结果

研究问题

  • RQ1MLM中的随机标记掩码是否因过度拟合到简单子词预测任务而导致预训练效率低下?
  • RQ2基于共现检测的系统性、数据驱动掩码策略是否能提升预训练效率和下游性能?
  • RQ3PMI-Masking与全词掩码和随机跨度掩码等启发式方法相比,在收敛速度和最终性能方面表现如何?
  • RQ4在使用不同掩码策略时,标准单标记困惑度与下游性能的相关性有多大?
  • RQ5使用更小的预训练语料和更少的训练样本,PMI-Masking能否在下游任务中取得优于大语料和随机掩码的性能?

主要发现

  • PMI-Masking在约一半的预训练时间达到先前掩码方法(如SpanBERT、RoBERTa)的下游性能水平。
  • 一个PMI-Masking Base尺寸的模型在多个下游任务上表现优于SpanBERT BASE 1–2个百分点,且在使用3倍小的语料和6倍少的训练样本的情况下,仍超越RoBERTa BASE。
  • 在RACE基准测试中,PMI-Masking模型得分比使用随机跨度掩码训练的SpanBERT BASE模型高出2分以上,即使在相同数量的训练样本下。
  • PMI-Masking训练的模型在100万步后达到单标记困惑度21.85,远高于随机标记掩码的2.96,表明最小化标准目标与下游成功无相关性。
  • PMI-Masking在预训练的每个评估点均持续优于随机跨度掩码,在训练进行到一半时即达到其最终性能水平。
  • 即使与更大参数量和更大预训练语料的模型相比,该方法仍表现更优,证明了其高效性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。