[论文解读] Can You Tell Me How to Get Past Sesame Street? Sentence-Level Pretraining Beyond Language Modeling
本文对超越语言建模的句子级预训练任务进行了大规模实证研究,在GLUE基准上评估了19项任务及其组合。研究发现,尽管语言建模仍是最有效的预训练目标,但多任务学习和中间微调仅带来适度提升,且存在性能不一致、灾难性遗忘以及跨任务迁移能力弱等问题。
Natural language understanding has recently seen a surge of progress with the use of sentence encoders like ELMo (Peters et al., 2018a) and BERT (Devlin et al., 2019) which are pretrained on variants of language modeling. We conduct the first large-scale systematic study of candidate pretraining tasks, comparing 19 different tasks both as alternatives and complements to language modeling. Our primary results support the use language modeling, especially when combined with pretraining on additional labeled-data tasks. However, our results are mixed across pretraining tasks and show some concerning trends: In ELMo's pretrain-then-freeze paradigm, random baselines are worryingly strong and results vary strikingly across target tasks. In addition, fine-tuning BERT on an intermediate task often negatively impacts downstream transfer. In a more positive trend, we see modest gains from multitask training, suggesting the development of more sophisticated multitask and transfer learning techniques as an avenue for further research.
研究动机与目标
- 系统评估19种不同的预训练任务在句子编码器中的有效性,超越标准的语言建模。
- 探究将语言建模与其他预训练任务结合是否能提升在NLP基准上的下游迁移性能。
- 评估中间微调对BERT和ELMo的影响,特别是此类步骤是否能增强或削弱其迁移能力。
- 识别不同下游任务从各种预训练目标中受益的模式,尤其是在相关性和数据敏感性方面的表现。
- 探索当前多任务学习与迁移学习方法在句子表示学习中的局限性。
提出的方法
- 在19项不同的预训练任务上微调一个标准化的BiLSTM编码器,包括语言建模以及自然语言蕴含、机器翻译等非LM任务。
- 在所有预训练任务中使用相同的模型架构和训练流程,以确保公平比较,并隔离损失函数的影响。
- 在将模型迁移至下游GLUE任务前,对ELMo和BERT在17项中间任务上进行微调,评估中间训练对最终性能的影响。
- 在GLUE基准的九项任务上训练并评估共53种不同的句子编码器,总计477个模型,以确保统计稳健性。
- 分析目标任务之间的性能相关性,并通过不同预训练和目标任务数据量下的学习曲线进行测量。
- 使用诊断数据集探测模型在特定语言现象(如词汇语义知识和逻辑推理)上的行为。
实验结果
研究问题
- RQ1在GLUE基准上,与语言建模相比,非语言建模任务的预训练在下游迁移性能方面表现如何?
- RQ2将语言建模与其他预训练任务结合,是否能在多样化的下游NLP任务中实现一致的性能提升?
- RQ3在次级任务(如MNLI或QQP)上对BERT或ELMo进行中间微调,是否能提升或降低其在下游GLUE任务上的性能?
- RQ4不同下游任务从不同预训练目标中受益的程度如何?其性能增益之间的相关性如何?
- RQ5数据量对预训练和微调的影响如何?在中间任务上微调的模型是否表现出灾难性遗忘的迹象?
主要发现
- 语言建模仍是单一预训练目标中最有效的,其在GLUE基准上优于所有其他单任务。
- 多任务预训练相比单任务预训练仅带来适度提升,但无法一致地结合各单任务的优势。
- 对BERT在MNLI或QQP等任务上进行中间微调,常导致性能下降,表明存在灾难性遗忘或负迁移现象。
- 预训练带来的性能增益高度依赖于下游任务,不同GLUE任务之间的性能增益相关性低,甚至为负。
- 学习曲线显示,增加预训练数据量可提升大多数任务的性能,但当与ELMo或BERT结合时,这种关系会变弱。
- 在受限数据上训练中间任务(如使用有限数据的MNLI)的某些模型,反而优于在完整数据集上训练的模型,表明可能存在过拟合或数据敏感性问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。