Skip to main content
QUICK REVIEW

[论文解读] Distilling Knowledge Learned in BERT for Text Generation

Yen-Chun Chen, Zhe Gan|arXiv (Cornell University)|Nov 10, 2019
Topic Modeling参考文献 58被引用 21
一句话总结

本文提出了一种知识蒸馏框架,通过一种新颖的条件掩码语言建模(C-MLM)微调方法,利用BERT的双向上下文,以改进自回归序列到序列模型的文本生成能力。通过使用微调后的BERT作为教师模型提供软概率目标,学生模型学习到全局连贯性,在IWSLT德语-英语和英语-越南语翻译基准上取得了最先进结果。

ABSTRACT

Large-scale pre-trained language model such as BERT has achieved great success in language understanding tasks. However, it remains an open question how to utilize BERT for language generation. In this paper, we present a novel approach, Conditional Masked Language Modeling (C-MLM), to enable the finetuning of BERT on target generation tasks. The finetuned BERT (teacher) is exploited as extra supervision to improve conventional Seq2Seq models (student) for better text generation performance. By leveraging BERT's idiosyncratic bidirectional nature, distilling knowledge learned in BERT can encourage auto-regressive Seq2Seq models to plan ahead, imposing global sequence-level supervision for coherent text generation. Experiments show that the proposed approach significantly outperforms strong Transformer baselines on multiple language generation tasks such as machine translation and text summarization. Our proposed model also achieves new state of the art on IWSLT German-English and English-Vietnamese MT datasets. Code is available at https://github.com/ChenRocks/Distill-BERT-Textgen.

研究动机与目标

  • 为解决自回归文本生成模型(其本身是自回归的且缺乏未来上下文)如何有效利用BERT的双向上下文知识的挑战。
  • 通过从微调后的BERT教师模型进行知识蒸馏,引入序列级监督,以改善文本生成的全局连贯性。
  • 开发一种模块化、与模型无关的方法,增强任意序列到序列模型,而无需架构约束或参数共享。
  • 通过轻量级、高效的蒸馏机制,在机器翻译和抽象摘要任务中实现最先进性能。

提出的方法

  • 提出条件掩码语言建模(C-MLM),一种扩展掩码语言建模(MLM)的微调目标,通过在输入序列上进行条件化,使BERT能够适应序列到序列任务。
  • 使用C-MLM在目标生成数据集上微调BERT,生成下一个词的软概率分布,同时结合左、右上下文信息。
  • 将微调后的BERT作为教师模型,为训练序列中的每个词生成软标签logits,提供全局序列级监督。
  • 通过修改后的最大似然估计(MLE)损失训练学生序列到序列模型(如Transformer),将BERT生成的软目标作为正则化项。
  • 引入一个蒸馏损失项 $\mathcal{L}_{\text{bidi}}$,促使学生模型在整个序列上匹配BERT教师的概率分布。
  • 在推理阶段将教师模型解耦,实现在测试时快速解码,同时保留在训练期间学习到的双向上下文优势。

实验结果

研究问题

  • RQ1能否通过知识蒸馏将BERT的双向上下文有效迁移到自回归文本生成模型中?
  • RQ2通过BERT引入的全局序列级监督是否能提升生成文本的连贯性和流畅性?
  • RQ3所提出的方法是否能在无架构约束的情况下,在多样化文本生成任务中实现最先进性能?
  • RQ4该蒸馏方法在不同输出长度下表现如何,特别是在长序列生成中?
  • RQ5该模型能否在不同生成任务(如机器翻译和抽象摘要)中实现良好泛化?

主要发现

  • 所提方法在IWSLT14德语-英语翻译数据集上达到新的最先进水平,优于强基线Transformer模型。
  • 在IWSLT15英语-越南语翻译数据集上,模型BLEU得分为27.85,比最佳基线高出0.86 BLEU点。
  • 对于长序列(N > 24),模型在IWSLT德语-英语数据集的长翻译中表现出一致改进,BLEU提升最高达10分。
  • 定性分析表明,模型通过在训练中利用未来上下文,避免了词选择错误(如“with”与“at”的混淆),从而生成更连贯的输出。
  • 蒸馏损失 $\mathcal{L}_{\text{bidi}}$ 显著提升了泛化能力,尤其在减少对独热标签的过度自信以及增强对上下文变化的鲁棒性方面效果明显。
  • 该方法与模型无关,兼容多种架构(包括Transformer和LSTM),无需参数共享或架构修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。