Skip to main content
QUICK REVIEW

[论文解读] Self-Distillation Mixup Training for Non-autoregressive Neural Machine Translation

Jiaxin Guo, Minghan Wang|arXiv (Cornell University)|Dec 22, 2021
Machine Learning and Data Classification被引用 8
一句话总结

该论文提出SDMRT,一种针对非自回归神经机器翻译(NAT)的增强型自蒸馏混合训练策略,通过在自蒸馏数据上引入预重排序(Pre-Rerank)和在过滤后的教师蒸馏数据上进行微调(Fine-Tune),解决了经典自蒸馏混合训练(SDM)在NAT模型上失效的问题。该方法有效降低了自回归教师(AT)与非自回归学生(NAT)之间的建模多样性(Modeling Diversity)和确认偏见(Confirmation Bias),在基线模型上实现0.6–1.2 BLEU的性能提升,并在迭代优化型NAT模型中实现2倍推理加速。

ABSTRACT

Recently, non-autoregressive (NAT) models predict outputs in parallel, achieving substantial improvements in generation speed compared to autoregressive (AT) models. While performing worse on raw data, most NAT models are trained as student models on distilled data generated by AT teacher models, which is known as sequence-level Knowledge Distillation. An effective training strategy to improve the performance of AT models is Self-Distillation Mixup (SDM) Training, which pre-trains a model on raw data, generates distilled data by the pre-trained model itself and finally re-trains a model on the combination of raw data and distilled data. In this work, we aim to view SDM for NAT models, but find directly adopting SDM to NAT models gains no improvements in terms of translation quality. Through careful analysis, we observe the invalidation is correlated to Modeling Diversity and Confirmation Bias between the AT teacher model and the NAT student models. Based on these findings, we propose an enhanced strategy named SDMRT by adding two stages to classic SDM: one is Pre-Rerank on self-distilled data, the other is Fine-Tune on Filtered teacher-distilled data. Our results outperform baselines by 0.6 to 1.2 BLEU on multiple NAT models. As another bonus, for Iterative Refinement NAT models, our methods can outperform baselines within half iteration number, which means 2X acceleration.

研究动机与目标

  • 解决经典自蒸馏混合训练(SDM)在直接应用于基于自回归(AT)蒸馏数据训练的非自回归(NAT)模型时性能不佳的问题。
  • 探究SDM在NAT训练中失效的根本原因,特别是AT教师与NAT学生之间建模多样性与确认偏见的作用。
  • 通过结构化的数据预处理与微调阶段,改进蒸馏过程,提升NAT模型性能。
  • 通过减少所需优化步数,加速迭代优化型NAT模型。

提出的方法

  • 使用AT模型在自蒸馏数据上引入预重排序阶段,以减少教师与学生模型之间的建模多样性。
  • 对AT蒸馏数据实施数据过滤策略,移除低质量或重复的预测结果,缓解确认偏见。
  • 在原始数据与过滤后重排序的蒸馏数据组合上微调NAT学生模型,以提升泛化能力。
  • 使用AT重排序(基于教师模型)与LM重排序(基于语言模型)评估重排序效果,AT重排序表现更优。
  • 在WMT14与IWSLT14数据集上,使用fairseq训练模型,预训练步数为240k,微调步数为60k。
  • 通过BLEU分数、困惑度与词元重复率评估性能,分析分布保真度与确认偏见。

实验结果

研究问题

  • RQ1为何经典自蒸馏混合训练(SDM)在直接应用于基于AT蒸馏数据训练的NAT模型时会失效?
  • RQ2AT教师与NAT学生之间的建模多样性与确认偏见如何影响SDM在NAT训练中的有效性?
  • RQ3预重排序与数据过滤阶段是否能通过降低多样性与偏见,提升SDM在NAT模型中的性能?
  • RQ4SDMRT在多大程度上可减少迭代优化型NAT模型中的优化迭代次数?
  • RQ5在SDMRT流程中,AT重排序与LM重排序哪种策略性能更优?

主要发现

  • SDMRT在WMT14与IWSLT14翻译任务的多个NAT模型上,相较基线模型实现0.6–1.2 BLEU的性能提升。
  • 在WMT14 EN→DE任务中,CMLM模型采用SDMRT仅需5次优化步骤即可达到原始模型的性能水平,相比标准的10步基线实现2倍加速。
  • 预重排序阶段使用AT重排序相比LM重排序效果更优,尤其在CMLM上相较基线实现0.74 BLEU的增益。
  • 微调阶段的数据过滤至关重要:从教师蒸馏数据中移除0.84%的低质量样本,可使NAT-CRF性能提升0.85 BLEU点。
  • 重新访问实验表明,重排序将NAT-CRF预测的平均困惑度从127.59降低至76.55,使预测分布更接近原始数据分布。
  • NAT-CRF的重复词元比例从SDM的0.937%降至SDMRT的0.533%,证实确认偏见得到有效缓解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。