Skip to main content
QUICK REVIEW

[论文解读] M3ST: Mix at Three Levels for Speech Translation

Xuxin Cheng, Qianqian Dong|arXiv (Cornell University)|Dec 7, 2022
Natural Language Processing Techniques被引用 14
一句话总结

本文提出 M³ST,一种用于端到端语音翻译的新颖数据增强方法,通过 Mixup 风格技术在词、句和帧三个层级混合训练数据。通过两阶段微调,包括 Jensen-Shannon 散度正则化,M³ST 在 MuST-C 基准上实现最先进性能,八条翻译方向的平均 BLEU 达到 29.9,甚至在某些情况下优于使用外部机器翻译数据的模型。

ABSTRACT

How to solve the data scarcity problem for end-to-end speech-to-text translation (ST)? It's well known that data augmentation is an efficient method to improve performance for many tasks by enlarging the dataset. In this paper, we propose Mix at three levels for Speech Translation (M^3ST) method to increase the diversity of the augmented training corpus. Specifically, we conduct two phases of fine-tuning based on a pre-trained model using external machine translation (MT) data. In the first stage of fine-tuning, we mix the training corpus at three levels, including word level, sentence level and frame level, and fine-tune the entire model with mixed data. At the second stage of fine-tuning, we take both original speech sequences and original text sequences in parallel into the model to fine-tune the network, and use Jensen-Shannon divergence to regularize their outputs. Experiments on MuST-C speech translation benchmark and analysis show that M^3ST outperforms current strong baselines and achieves state-of-the-art results on eight directions with an average BLEU of 29.9.

研究动机与目标

  • 为解决端到端语音翻译中的数据稀缺问题,该问题因并行语音-转录-翻译数据有限而限制模型性能。
  • 通过多层级数据增强引入多样化训练样本,提升模型泛化能力和鲁棒性。
  • 有效结合有限的语音翻译数据与外部机器翻译(MT)数据。
  • 探究在不同层级(词、句、帧)进行混合对模型性能的影响。
  • 证明结合多个层级的混合方法相较于单层级增强可取得更优性能。

提出的方法

  • 该方法执行两阶段微调:首先,使用 Mixup 风格方法以混合比例 λ=0.4 在三个层级(词、句、帧)混合训练数据。
  • 在词层级,将转录中的名词替换为语义相似的词,并对齐相应的语音和翻译片段进行替换。
  • 在句层级,将来自不同说话人的两个句子拼接,同时保留各自的语音与翻译对。
  • 在帧层级,将两个语音特征序列以权重 λ 线性组合,对应的目标序列用于计算加权平均交叉熵损失。
  • 在第二阶段,将原始语音和转录序列并行输入模型,使用 Jensen-Shannon 散度对两个分支的输出分布进行正则化。
  • 模型使用预训练的 Hubert 编码器提取语音特征,采用基于 Transformer 的翻译编码器和解码器,并使用 Adam 优化器进行微调,配合早停策略。

实验结果

研究问题

  • RQ1与单层级增强相比,多层级数据混合(词、句、帧)是否能提升端到端语音翻译性能?
  • RQ2各混合层级(词、句、帧)对整体性能提升的相对贡献如何?
  • RQ3在早期网络层(尤其是帧层级)进行混合,是否能增强模型的鲁棒性和泛化能力?
  • RQ4使用外部 MT 数据与多层级混合相结合,如何影响性能提升?
  • RQ5所提出的两阶段微调策略结合 JS 散度正则化,是否能带来更好的对齐效果和输出一致性?

主要发现

  • M³ST 在 MuST-C 基准的八个翻译方向上实现了新的最先进平均 BLEU 得分为 29.9,优于强基线模型。
  • 在无外部 MT 数据的情况下,M³ST 相比之前最佳模型提升 0.6 BLEU,证明多层级混合本身具有显著有效性。
  • 在使用外部 MT 数据时,M³ST 平均比之前 SOTA 模型高出 0.5 BLEU,表明数据增强与外部数据之间存在强大协同效应。
  • 消融实验表明,帧层级混合贡献最大,移除后 BLEU 下降 0.5,表明其在提升鲁棒性方面具有关键作用。
  • 在输入嵌入层(第 0 层)进行混合可获得最佳性能,表明早期融合声学特征能增强表征学习。
  • 该方法在多种语言对(包括低资源方向)中均表现稳健,在所有评估设置下均保持一致的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。