[论文解读] Bridging the Gap between Pre-Training and Fine-Tuning for End-to-End Speech Translation
本文提出一种级联式连接主义编码网络(TCEN),用于端到端语音翻译,通过重用所有子网络、保持各阶段中一致的角色设定以及预训练注意力模块,弥合了预训练与微调之间的差距。该方法通过共享投影矩阵和长度镜像数据增强,强制实现语音与文本表征之间的语义一致性和长度一致性,从而在LibriSpeech En-Fr数据集上实现高达17.05的BLEU提升。
End-to-end speech translation, a hot topic in recent years, aims to translate a segment of audio into a specific language with an end-to-end model. Conventional approaches employ multi-task learning and pre-training methods for this task, but they suffer from the huge gap between pre-training and fine-tuning. To address these issues, we propose a Tandem Connectionist Encoding Network (TCEN) which bridges the gap by reusing all subnets in fine-tuning, keeping the roles of subnets consistent, and pre-training the attention module. Furthermore, we propose two simple but effective methods to guarantee the speech encoder outputs and the MT encoder inputs are consistent in terms of semantic representation and sequence length. Experimental results show that our model outperforms baselines 2.2 BLEU on a large benchmark dataset.
研究动机与目标
- 解决端到端语音翻译模型中预训练与微调之间存在的巨大差距。
- 通过重用所有预训练组件(包括机器翻译编码器)来克服子网络浪费问题。
- 通过解耦声学与语言特征提取,确保预训练与微调阶段中各模块角色的一致性。
- 对注意力模块进行预训练,以利用预训练过程中获得的对齐知识。
- 实现语音编码器输出与机器翻译编码器输入之间的语义一致性和序列长度一致性。
提出的方法
- 提出一种包含语音编码器、文本编码器和目标解码器的级联式连接主义编码网络(TCEN),其中语音编码器通过CTC损失进行预训练,无需解码器。
- 重用预训练的机器翻译编码器与解码器,避免丢弃有价值的子网络。
- 将CTC层中的线性投影矩阵与词嵌入矩阵共享,以在相同潜在空间中对齐语音与文本表征。
- 通过添加词重复和空白标记来延长机器翻译源句,使其模仿CTC输出序列,从而确保序列长度一致性。
- 在微调阶段采用多任务学习,同时优化ASR、MT和ST目标,使用预训练子网络作为初始化。
- 对来自机器翻译模型的注意力模块进行预训练,以应用于语音翻译任务,避免随机初始化。
实验结果
研究问题
- RQ1为何现有的端到端语音翻译模型无法充分利用来自ASR和MT任务的预训练知识?
- RQ2如何减少端到端语音翻译中预训练与微调之间的领域差距?
- RQ3哪些机制能够确保语音编码器输出与机器翻译编码器输入之间的语义与序列长度一致性?
- RQ4对注意力模块进行预训练在多大程度上能提升语音翻译性能?
- RQ5能否设计一种统一架构,使所有预训练子网络在训练各阶段中均可复用,且角色保持一致?
主要发现
- TCEN在LibriSpeech En-Fr数据集上达到17.05的BLEU分数,优于所有预训练基线模型以及采用蒸馏知识的模型。
- 消融实验表明,若移除参数共享,BLEU平均下降1.45分,表明语义一致性比噪声注入更为关键。
- 若移除预训练,BLEU分数急剧下降至8.98–8.42,证实预训练对性能至关重要。
- 学习曲线显示,TCEN在微调初期即具备更高的验证准确率,并在整个训练过程中持续保持优势,表明其初始化更优。
- 该方法在LSTM与Transformer骨干网络上均表现提升,证明其在不同架构上的泛化能力。
- 与原始多任务学习基线相比,TCEN性能提升5 BLEU点,且在性能上匹配或超越使用教师模型蒸馏知识的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。