Skip to main content
QUICK REVIEW

[论文解读] Large-Scale Self- and Semi-Supervised Learning for Speech Translation

Changhan Wang, Anne Wu|arXiv (Cornell University)|Apr 14, 2021
Natural Language Processing Techniques参考文献 43被引用 7
一句话总结

本文提出了一种简单但高效的方法进行语音翻译(ST),仅利用 CoVoST 2 数据,通过结合 wav2vec 2.0 自监督预训练、在大规模未标注 Libri-Light 语音数据上的单轮自训练,以及语言模型解码,实现了在四个语言对上的新 SOTA 平均 BLEU 得分 25.6,相比之前的工作提升了 2.6 BLEU,且未使用任何额外的监督信息。

ABSTRACT

In this paper, we improve speech translation (ST) through effectively leveraging large quantities of unlabeled speech and text data in different and complementary ways. We explore both pretraining and self-training by using the large Libri-Light speech audio corpus and language modeling with CommonCrawl. Our experiments improve over the previous state of the art by 2.6 BLEU on average on all four considered CoVoST 2 language pairs via a simple recipe of combining wav2vec 2.0 pretraining, a single iteration of self-training and decoding with a language model. Different to existing work, our approach does not leverage any other supervision than ST data. Code and models will be publicly released.

研究动机与目标

  • 通过仅使用未标注的语音和文本数据来提升语音翻译性能,避免依赖额外的 ASR 或机器翻译标注数据。
  • 探究在语音翻译背景下,无监督预训练、自训练和语言建模的有效性及其互补性。
  • 建立一个仅依赖 ST 数据的强而简洁的基线模型,其性能优于以往方法,且所需监督更少。

提出的方法

  • 在 53,000 小时的未标注 Libri-Light 语音数据上预训练 wav2vec 2.0 模型,以学习鲁棒的语音表征。
  • 在 CoVoST 2 ST 数据上微调预训练编码器与随机初始化的 Transformer 解码器,构建教师模型。
  • 利用教师模型为 60,000 小时的未标注 Libri-Light 语音生成伪标签,构建用于自训练的合成训练数据。
  • 在真实 CoVoST 2 数据与伪标签化的 Libri-Light 数据组合上训练学生模型,并对数据进行上采样以平衡重要性。
  • 在单语 CommonCrawl 数据上训练目标语言语言模型,并在束搜索解码过程中应用浅层融合以提升生成质量。
  • 将所有组件——预训练、自训练和语言建模——整合到统一的流水线中,以最大化性能。

实验结果

研究问题

  • RQ1在无额外监督的前提下,自监督预训练与自训练能否有效结合以提升语音翻译性能?
  • RQ2未标注语音和文本数据的规模如何影响语音翻译模型的性能?
  • RQ3在低资源 ST 设置下,将语言模型解码与自训练及预训练结合是否能提升翻译质量?
  • RQ4结合预训练与自训练所带来的性能提升是否在多个语言对上保持一致?
  • RQ5在不使用适配器或 LNA 微调的情况下,简化模型架构是否仍能超越更复杂的先前模型?

主要发现

  • 所提方法在 CoVoST 2 基准上实现了四个语言对的 SOTA 平均 BLEU 得分 25.6,相比之前 SOTA 提升了 2.6 BLEU。
  • 在 60,000 小时的 Libri-Light 数据上进行自训练,相比仅使用 wav2vec 2.0 预训练,性能提升了 2.3 BLEU,证明了其与预训练的强互补性。
  • 语言模型解码相比仅预训练基线提升了 1.1 BLEU,相比预训练 + 自训练设置提升了 1.0 BLEU。
  • 在更大规模的未标注语音数据上进行预训练(60,000 小时 vs. 960 小时)带来了 3.0 BLEU 的平均性能提升,证实了数据规模的优势。
  • 将自训练数据从 960 小时扩展到 60,000 小时,分别带来了 0.6 BLEU 和 0.5 BLEU 的增量收益,表明更多数据仍具持续增益。
  • 该方法优于先前使用 mBART 和额外 MT 数据的工作,证明仅依赖 ST 数据且无额外监督即可实现性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。