[论文解读] Self-Supervised Representations Improve End-to-End Speech Translation
本论文表明,自监督语音表征——特别是 wav2vec、vq-wav2vec 和 BERT 特征——在高资源和低资源设置下均能显著提升端到端语音翻译(ST)性能。这些特征在英语无标签数据上预训练后,可有效迁移至其他语言,且仅需极少微调。将这些特征与自动语音识别(ASR)预训练结合,可进一步提升性能,尤其在低资源场景下效果更显著。
End-to-end speech-to-text translation can provide a simpler and smaller system but is facing the challenge of data scarcity. Pre-training methods can leverage unlabeled data and have been shown to be effective on data-scarce settings. In this work, we explore whether self-supervised pre-trained speech representations can benefit the speech translation task in both high- and low-resource settings, whether they can transfer well to other languages, and whether they can be effectively combined with other common methods that help improve low-resource end-to-end speech translation such as using a pre-trained high-resource speech recognition system. We demonstrate that self-supervised pre-trained features can consistently improve the translation performance, and cross-lingual transfer allows to extend to a variety of languages without or with little tuning.
研究动机与目标
- 探究自监督预训练语音表征是否能在高资源和低资源设置下提升端到端语音翻译性能。
- 评估这些表征在无需或仅需极少微调的情况下向低资源语言的跨语言迁移能力。
- 检验将自监督特征与预训练 ASR 系统结合在低资源 ST 中的有效性。
- 评估在使用预训练方法时,ASR 性能是否可作为下游 ST 性能的可靠代理指标。
提出的方法
- 采用自监督预训练方法:wav2vec(对比预测编码)、vq-wav2vec(向量量化表征)和 BERT(在离散化表征上)。
- 将这些预训练特征作为输入表征,应用于带有注意力机制的序列到序列 BiLSTM 编码器-解码器模型,用于 ST 任务。
- 探索一种混合 BERT 主干架构,即使用预训练 BERT 模型作为低资源 ST 任务的编码器。
- 在目标语言(如法语、中文)的 Common Voice 数据上微调预训练特征,以提升跨语言迁移效果。
- 将预训练的 ASR 模型(在英语和目标语言数据上训练)用于初始化 ST 编码器,以提升低资源设置下的泛化能力。
- 使用对数梅尔滤波器组作为基线特征,用于所有实验的对比。
实验结果
研究问题
- RQ1自监督语音表征是否能在高资源和低资源设置下提升端到端语音翻译性能?
- RQ2自监督特征在无需额外微调的情况下,向低资源语言的迁移效果如何?
- RQ3将自监督特征与 ASR 预训练结合,是否能获得优于单独使用任一方法的 ST 性能?
- RQ4在预训练任务中,ASR 性能是否可作为下游 ST 性能的可靠预测指标?
主要发现
- 在英语到X语言和X语言到英语的设置下,自监督特征(wav2vec、vq-wav2vec、BERT)在所有实验中均显著优于对数梅尔滤波器组基线。
- 将预训练的英语特征迁移至11种低资源语言,在未微调的情况下也取得了性能提升,但性能增益受数据量和语言相似性影响。
- 在目标语言 Common Voice 数据上微调 BERT 特征后,Fr-En ST 的 BLEU 分数最高提升 +1.3,Zh-En ST 提升 +1.1,优于冻结特征。
- 使用多语言 ASR 模型(英语+目标语言)预训练 ST 编码器,其 ST 性能优于仅用英语 ASR 预训练编码器和解码器,Es-En ST 最高提升 +1.6 BLEU。
- 在某些情况下,ASR 词错误率(WER)较高的模型(如 vq-wav2vec)仍能产生比 WER 较低的模型(如 BERT)更好的 ST 结果,表明 ASR WER 并非 ST 性能的可靠预测指标。
- BERT 主干架构在低资源设置下(如 Zh-En ST 的 6.8 BLEU)优于从零开始训练,但其性能仍不及 ASR 预训练方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。