[论文解读] Source and Target Bidirectional Knowledge Distillation for End-to-end Speech Translation
本文提出了一种用于端到端语音翻译(E2E-ST)的源-目标双向知识蒸馏方法(SeqKD),通过利用反向神经机器翻译(NMT)模型生成的改写源转录和正向NMT模型蒸馏的翻译结果。通过训练单一解码器同时预测目标翻译和源改写,该方法增强了语义表征学习,在自回归与非自回归模型中均持续提升性能,双向SeqKD优于单向变体,并在不同模型规模下具有良好的泛化能力。
A conventional approach to improving the performance of end-to-end speech translation (E2E-ST) models is to leverage the source transcription via pre-training and joint training with automatic speech recognition (ASR) and neural machine translation (NMT) tasks. However, since the input modalities are different, it is difficult to leverage source language text successfully. In this work, we focus on sequence-level knowledge distillation (SeqKD) from external text-based NMT models. To leverage the full potential of the source language information, we propose backward SeqKD, SeqKD from a target-to-source backward NMT model. To this end, we train a bilingual E2E-ST model to predict paraphrased transcriptions as an auxiliary task with a single decoder. The paraphrases are generated from the translations in bitext via back-translation. We further propose bidirectional SeqKD in which SeqKD from both forward and backward NMT models is combined. Experimental evaluations on both autoregressive and non-autoregressive models show that SeqKD in each direction consistently improves the translation performance, and the effectiveness is complementary regardless of the model capacity.
研究动机与目标
- 为解决在端到端语音翻译(E2E-ST)中有效利用源语言文本的挑战,其中自动语音识别(ASR)与机器翻译(MT)任务的输入模态存在差异。
- 克服辅助ASR训练的局限性,该方法使模型偏向声学而非语义表征。
- 通过序列级知识蒸馏(SeqKD)利用基于文本的NMT模型中的语义知识,提升E2E-ST性能。
- 提出利用从目标到源NMT模型生成的改写源转录的反向SeqKD。
- 开发双向SeqKD,结合正向与反向NMT模型的知识,以增强模型的泛化能力与鲁棒性。
提出的方法
- 在平行双语语料上训练正向NMT模型,生成用于E2E-ST训练的蒸馏目标翻译。
- 训练反向NMT模型(目标到源)以从目标翻译中生成源转录的改写版本。
- 将生成的改写文本作为辅助训练目标,与真实翻译并列用于单一解码器架构。
- 通过联合训练E2E-ST模型在蒸馏翻译(正向)和改写源转录(反向)上,实现双向SeqKD。
- 采用序列级知识蒸馏,并结合束搜索解码,从预训练的NMT模型中生成高质量、多样化的训练数据。
- 使用基于对齐的条件熵与KL散度,衡量蒸馏数据分布的语料级复杂性与忠实度。
实验结果
研究问题
- RQ1能否通过利用目标到源NMT模型的反向序列级知识蒸馏,借助源语言语义信息提升E2E-ST性能?
- RQ2将正向与反向SeqKD结合是否能优于单向SeqKD,从而在E2E-ST中取得更优性能?
- RQ3双向SeqKD如何影响不同模型架构(包括非自回归模型)下的模型泛化能力?
- RQ4与原始数据分布相比,神经改写方法在多大程度上保持了忠实度与复杂性?
- RQ5所提出方法在大规模E2E-ST模型中是否仍能维持性能增益?
主要发现
- 双向SeqKD在自回归与非自回归E2E-ST模型中均一致提升翻译性能,在Fisher与Must-C数据集上均观察到性能增益。
- 仅使用反向SeqKD即可在Fisher数据集上提升1.2 BLEU,在Must-C数据集上提升1.8 BLEU,证明了源改写监督的价值。
- 仅使用正向SeqKD可在Fisher数据集上提升1.0 BLEU,在Must-C数据集上提升1.5 BLEU,表明蒸馏目标翻译的有效性。
- 正向与反向SeqKD的结合达到最高性能,在Must-C数据集上相比单向SeqKD最高提升2.0 BLEU。
- 双向SeqKD在不同模型容量下(包括大型Conformer模型)均保持有效性。
- 蒸馏数据保持了高忠实度与合理的复杂性,KL散度与条件熵的测量结果表明知识迁移可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。