Skip to main content
QUICK REVIEW

[论文解读] Knowledge Inheritance for Pre-trained Language Models

Yujia Qin, Yankai Lin|arXiv (Cornell University)|May 28, 2021
Natural Language Processing Techniques被引用 10
一句话总结

本文提出知识继承(Knowledge Inheritance, KI),一种利用预训练的小型语言模型通过知识蒸馏来高效训练大型语言模型的框架。通过在预训练过程中引入知识蒸馏作为辅助监督,KI 显著提升了训练效率和数据效率,实现了更快的收敛速度和更优的性能表现——尤其在低资源设置和领域适应场景中效果显著。

ABSTRACT

Recent explorations of large-scale pre-trained language models (PLMs) have revealed the power of PLMs with huge amounts of parameters, setting off a wave of training ever-larger PLMs. However, it requires tremendous computational resources to train a large-scale PLM, which may be practically unaffordable. In addition, existing large-scale PLMs are mainly trained from scratch individually, ignoring that many well-trained PLMs are available. To this end, we explore the question how could existing PLMs benefit training large-scale PLMs in future. Specifically, we introduce a pre-training framework named "knowledge inheritance" (KI) and explore how could knowledge distillation serve as auxiliary supervision during pre-training to efficiently learn larger PLMs. Experimental results demonstrate the superiority of KI in training efficiency. We also conduct empirical analyses to explore the effects of teacher PLMs' pre-training settings, including model architecture, pre-training data, etc. Finally, we show that KI could be applied to domain adaptation and knowledge transfer.

研究动机与目标

  • 解决从零开始训练大规模预训练语言模型(PLM)所面临的高计算成本和资源密集问题。
  • 探索如何利用现有、已充分训练的 PLM 来提升更大规模 PLM 的训练效率。
  • 研究是否能够系统性地将小型 PLM 的知识跨多代逐步传递给规模不断增长的模型。
  • 考察教师 PLM 的不同预训练设置(如模型架构、训练数据和训练目标)对知识继承效果的影响。
  • 将 KI 框架扩展至领域适应场景,使大型 PLM 能够通过小型、领域特定的教师模型高效适应新领域。

提出的方法

  • 提出知识继承(KI),一种预训练框架,利用小型、预训练的教师 PLM 的知识蒸馏来指导更大规模学生 PLM 的训练。
  • 在学生模型的自监督预训练阶段应用知识蒸馏,使用教师模型生成的软标签作为辅助监督信号。
  • 采用蒸馏损失函数,使学生模型在掩码 token 上的输出 logits 与教师模型保持对齐,从而在预训练过程中增强知识迁移效果。
  • 支持教师与学生模型之间的灵活架构匹配,避免了传统参数复用方法中常见的严格架构约束。
  • 将 KI 框架应用于通用预训练和领域适应两种场景,其中多个领域特定的小型 PLM 作为教师,以提升大型 PLM 在特定领域上的表现。
  • 实现一种基于预训练设置(包括模型架构和数据分布)选择最优教师的策略。

实验结果

研究问题

  • RQ1从已训练的小型 PLM 中蒸馏知识,是否能够提升从零开始训练的大规模 PLM 的训练效率?
  • RQ2知识继承是否可以按序列应用于一系列规模逐步增大的 PLM 上,实现跨代的累积知识传递?
  • RQ3教师 PLM 的不同预训练设置(如模型架构、预训练数据和训练目标)如何影响知识继承的效果?
  • RQ4KI 是否能通过使已训练的大规模 PLM 从小型、领域特定的教师模型中受益,从而增强领域适应能力?
  • RQ5在低资源条件下,KI 与自学习方法相比,在训练效率和数据效率方面表现如何,尤其在资源受限场景下?

主要发现

  • KI 显著提升训练效率:在相同训练预算下,学生模型的最终困惑度(PPL)更低,下游任务性能更优,优于自学习方法。
  • KI 提升数据效率:当仅使用有限的领域特定数据时,KI 与自学习方法之间的性能差距进一步扩大,表明 KI 在低资源设置下更具优势。
  • KI 支持多领域知识迁移:大型 PLM 可同时从多个领域特定的教师模型中吸收知识,并在所有领域上实现性能提升,实验结果基于合成的 CS:BIO 数据集验证了这一点。
  • 顺序知识继承是可行的:知识可在多代规模不断增长的 PLM 间累积传递,展现出显著的累积学习潜力。
  • KI 在领域适应中优于自学习:即使在极少领域特定数据的情况下,KI 的性能仍优于自学习方法,后者在低资源条件下易出现过拟合。
  • 教师模型的选择至关重要:实证分析表明,使用多样化数据预训练且架构合适的教师模型可实现更优的知识迁移,表明教师选择是 KI 成功的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。