[论文解读] Pre-training Text Representations as Meta Learning
本文提出将文本表示预训练作为模型无关元学习(MAML),直接针对下游任务性能进行优化,而非代理目标(如语言建模)。通过在预训练过程中引入一系列元训练步骤,该方法学习到更优的初始化,相较于 BERT 在多种自然语言处理任务上表现更优,并在首次微调阶段即展现出更快的收敛速度。
Pre-training text representations has recently been shown to significantly improve the state-of-the-art in many natural language processing tasks. The central goal of pre-training is to learn text representations that are useful for subsequent tasks. However, existing approaches are optimized by minimizing a proxy objective, such as the negative log likelihood of language modeling. In this work, we introduce a learning algorithm which directly optimizes model's ability to learn text representations for effective learning of downstream tasks. We show that there is an intrinsic connection between multi-task pre-training and model-agnostic meta-learning with a sequence of meta-train steps. The standard multi-task learning objective adopted in BERT is a special case of our learning algorithm where the depth of meta-train is zero. We study the problem in two settings: unsupervised pre-training and supervised pre-training with different pre-training objects to verify the generality of our approach.Experimental results show that our algorithm brings improvements and learns better initializations for a variety of downstream tasks.
研究动机与目标
- 解决预训练代理目标(如语言建模)与学习对下游任务有用的表示这一真实目标之间的不匹配问题。
- 探究是否可将预训练重新诠释为元学习,以改善下游微调的模型初始化。
- 评估所提出的基于元学习的预训练在无监督和有监督设置下的有效性,涵盖多种预训练目标。
- 证明该方法即使在轻量级模型(如 ELMo)上,也能从零开始学习到更优的表示。
- 通过实证结果表明,元学习得到的初始化可在微调初期实现更快且更优的收敛。
提出的方法
- 将预训练重新表述为模型无关元学习(MAML),使模型在经过少量梯度更新后能快速适应下游任务。
- 在预训练过程中引入一系列元训练步骤,模型在元更新步骤前先基于任务特定梯度进行更新。
- 当元训练步骤数为零时,该方法退化为 BERT 中的标准多任务学习目标。
- 将元学习算法同时应用于无监督预训练(如掩码语言建模)和有监督预训练(如句子对匹配)。
- 采用两阶段流程:先在下游任务梯度上执行元训练步骤,随后进行元更新以优化初始化。
- 在 BERT 和 ELMo 架构上均验证了该方法,包括从随机初始化开始训练。
实验结果
研究问题
- RQ1能否有效将文本表示预训练重新框架为元学习,以提升下游任务性能?
- RQ2预训练期间元训练步骤的数量如何影响所学初始化的质量?
- RQ3所提出的基于元学习的预训练是否在多种下游任务上优于标准代理目标预训练(如 BERT)?
- RQ4该方法是否能从零开始学习到更优的表示,即使在轻量级模型(如 ELMo)上也成立?
- RQ5元学习得到的模型是否在微调初期即实现更优性能,表明其初始化更优?
主要发现
- 所提出的基于元学习的预训练方法在所有评估的下游任务上均优于 BERT,包括 SST-2、MNLI、SNLI、CLOTH 和 QDC。
- 在 QDC 数据集上,k=10 的元训练步骤模型达到 86.05% 的准确率,超过 BERT 在收敛时的 85.44%。
- 最佳性能始终出现在 k=5 或 k=10 的元训练步骤,而 k=20 时性能下降,表明存在最优的元训练深度。
- 在首次微调阶段,k≥1 的模型在 SST-2、SST-5 和 QDC 上的准确率均高于 BERT,证实其初始化更优。
- 当使用元学习方法从随机初始化预训练 ELMo 时,SNLI 上达到 88.3% 的准确率,优于官方 ELMo 的 88.0%。
- 当使用官方 ELMo 作为初始化并应用元学习后,SNLI 上的性能进一步提升至 88.5%,表明该方法可增强即使已较强的初始点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。