Skip to main content
QUICK REVIEW

[论文解读] Curriculum learning for language modeling

Daniel Campos|arXiv (Cornell University)|Aug 4, 2021
Topic Modeling参考文献 19被引用 13
一句话总结

本文研究了在 Wikitext-2 和 Wikitext-103 上使用 ELMo 进行语言模型预训练时的课程学习(CL),通过基于能力的课程(CBC)应用语言学启发的课程,如基于词频、三元语法和词性标注的难度启发式方法。尽管进行了大量实验,作者发现预训练困惑度或下游 GLUE 性能均无一致提升,甚至观察到随机课程与结构化课程效果相当,表明在此背景下课程学习的收益有限。

ABSTRACT

Language Models like ELMo and BERT have provided robust representations of natural language, which serve as the language understanding component for a diverse range of downstream tasks.Curriculum learning is a method that employs a structured training regime instead, which has been leveraged in computer vision and machine translation to improve model training speed and model performance. While language models have proven transformational for the natural language processing community, these models have proven expensive, energy-intensive, and challenging to train. In this work, we explore the effect of curriculum learning on language model pretraining using various linguistically motivated curricula and evaluate transfer performance on the GLUE Benchmark. Despite a broad variety of training methodologies and experiments we do not find compelling evidence that curriculum learning methods improve language model training.

研究动机与目标

  • 评估课程学习是否能提升语言模型预训练的效率与性能。
  • 研究基于语言学的课程(如词频、n-gram 复杂度、句子长度和词性标注)对 ELMo 预训练的影响。
  • 评估基于能力的课程(CBC)训练策略是否能提升在 GLUE 基准上的迁移学习性能。
  • 确定结构化课程是否优于随机采样在语言模型预训练中的表现。
  • 探讨预训练困惑度与下游迁移性能之间的脱节现象。

提出的方法

  • 作者实施了基于能力的课程(CBC)训练,其中模型能力随时间推移而提升,仅使用低于当前能力阈值的样本进行训练。
  • 每个训练样本通过启发式方法分配难度分数,包括词频稀有度、三元语法复杂度、句子长度、词性标注和依存句法解析深度。
  • 模型从初始能力水平 λ₀ 开始,每完成一个训练步骤后按固定增量提升,初始阶段仅允许访问较简单的样本。
  • 在 Wikitext-2 和 Wikitext-103 上进行实验,固定训练时间与超参数,以隔离课程结构的影响。
  • 在 GLUE 基准上评估迁移性能,涵盖 12 项任务,包括 SST、MRPC、QNLI 和 MNLI。
  • 消融研究对比了 CBC 与随机课程、无课程和基线随机采样方法。

实验结果

研究问题

  • RQ1课程学习是否能提升在 Wikitext-2 和 Wikitext-103 数据集上的语言模型预训练性能?
  • RQ2基于语言学的课程(如词频、三元语法、词性标注)是否能带来优于随机或非结构化采样的下游迁移性能?
  • RQ3与标准训练相比,使用 CBC 是否能显著改善预训练困惑度?
  • RQ4预训练目标上的表现是否与下游 GLUE 性能相关?
  • RQ5随机课程选择是否能实现与结构化、语言学启发课程相当甚至更优的结果?

主要发现

  • 在任何课程方法中均未观察到预训练困惑度的稳定提升,许多基于 CBC 的模型表现出高且不稳定的困惑度,表明存在过拟合或收敛性差的问题。
  • 尽管预训练性能较差,但使用 CBC 方法训练的模型在下游 GLUE 任务中仍表现出良好迁移能力,表明预训练损失并非迁移性能的可靠预测指标。
  • 在多个 GLUE 任务(如 MRPC 和 QNLI)中,随机课程的表现与或优于结构化课程,挑战了结构化难度排序是必要的假设。
  • 基于三元语法的课程在 Wikitext-103 上表现略优,但增益微小,且在所有任务中均未达到统计显著性。
  • 基于词性标注和依存句法的课程表现出不一致的行为,验证困惑度波动较大,表明这些启发式方法的超参数匹配不佳。
  • 作者未发现任何特定语言学启发式方法(如词频、三元语法、句子长度)比其他方法更有效,且结构化课程相比随机采样并无明显优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。