Skip to main content
QUICK REVIEW

[论文解读] Mu$^{2}$SLAM: Multitask, Multilingual Speech and Language Models

Yong Cheng, Yu Zhang|arXiv (Cornell University)|Dec 19, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

Mu²SLAM 提出了一种统一的、多语言的、多任务的序列到序列模型,通过在超过100种语言的无标签语音、无标签文本以及有监督的自动语音识别(ASR)、语音翻译(AST)和机器翻译(MT)数据上进行联合预训练,实现了卓越性能。通过采用共享的编码器-解码器架构,并结合掩码去噪和掩码语言建模目标,该模型在 CoVoST 上实现了最先进结果(xx-en 方向提升 1.9 BLEU,en-xx 方向提升 1.1 BLEU),并在 XNLI 和 TydiQA 等文本基准上缩小了与 mT5 模型的性能差距。

ABSTRACT

We present Mu$^{2}$SLAM, a multilingual sequence-to-sequence model pre-trained jointly on unlabeled speech, unlabeled text and supervised data spanning Automatic Speech Recognition (ASR), Automatic Speech Translation (AST) and Machine Translation (MT), in over 100 languages. By leveraging a quantized representation of speech as a target, Mu$^{2}$SLAM trains the speech-text models with a sequence-to-sequence masked denoising objective similar to T5 on the decoder and a masked language modeling (MLM) objective on the encoder, for both unlabeled speech and text, while utilizing the supervised tasks to improve cross-lingual and cross-modal representation alignment within the model. On CoVoST AST, Mu$^{2}$SLAM establishes a new state-of-the-art for models trained on public datasets, improving on xx-en translation over the previous best by 1.9 BLEU points and on en-xx translation by 1.1 BLEU points. On Voxpopuli ASR, our model matches the performance of an mSLAM model fine-tuned with an RNN-T decoder, despite using a relatively weaker sequence-to-sequence architecture. On text understanding tasks, our model improves by more than 6\% over mSLAM on XNLI, getting closer to the performance of mT5 models of comparable capacity on XNLI and TydiQA, paving the way towards a single model for all speech and text understanding tasks.

研究动机与目标

  • 开发一种统一的多语言语音与文本模型,通过联合学习多种模态和任务,无需模态特异性组件。
  • 解决先前模型将语音与文本分开处理或使用模态特异性头的问题,从而削弱表示共享。
  • 通过在无标签和有标签数据上进行多任务预训练,提升跨语言和跨模态表示对齐。
  • 通过新颖的微调策略(渐进式微调和噪声微调)提升下游性能,减少预训练与微调之间的分布差异。
  • 缩小语音-文本模型与纯文本模型在多语言自然语言理解基准(如 XTREME)上的性能差距。

提出的方法

  • 在超过100种语言上预训练单一编码器-解码器模型,使用无标签语音、无标签文本以及有监督的 ASR、AST 和 MT 数据。
  • 对编码器应用掩码语言建模(MLM)目标,适用于语音和文本输入;对解码器应用类似 T5 的去噪目标。
  • 对无标签和有标签数据使用统一的损失函数,降低架构复杂度并促进表示共享。
  • 使用单一的 CNN 模块进行语音表征提取,避免使用模态特异性编码器,以实现模态无关的学习。
  • 通过渐进式微调策略,先在有标签数据上继续预训练,再进行任务特异性微调,以减少分布差异。
  • 通过在微调过程中扰动解码器输入实施噪声微调,提升在语音翻译任务上的鲁棒性和性能。

实验结果

研究问题

  • RQ1一个统一的序列到序列模型是否能够跨100多种语言联合预训练语音和文本数据,从而在语音和文本任务上均实现强大性能?
  • RQ2通过多任务目标(MLM、去噪、对齐)进行联合预训练,如何提升跨语言和跨模态的表示学习?
  • RQ3渐进式和噪声微调策略在多大程度上减少了预训练与微调之间的差异,从而提升下游性能?
  • RQ4与专用模型(如使用 RNN-T 解码器的 mSLAM)相比,统一模型在 ASR 和 AST 基准上的性能如何?
  • RQ5统一模型是否能够缩小与强大纯文本模型(如 mT5)在多语言 NLU 基准上的性能差距?

主要发现

  • Mu²SLAM 在多语言语音翻译任务 CoVoST 上实现了新的最先进性能,相比先前公开模型,xx-en 方向提升 1.9 BLEU,en-xx 方向提升 1.1 BLEU。
  • 在 Voxpopuli ASR 任务上,尽管使用的是性能较弱的 Transformer 解码器,Mu²SLAM 的性能仍与使用 RNN-T 解码器微调的 mSLAM 模型相当。
  • 在 XNLI 基准上,Mu²SLAM 相比 mSLAM 提升超过 6%,并更接近同等规模 mT5 模型的性能。
  • 在 TydiQA 上,Mu²SLAM 的性能与同等容量的 mT5 模型相当,展现出强大的多语言文本理解能力。
  • 消融实验证明,在预训练中引入 ASR 和 AST 数据能显著提升 AST 性能,尤其对低资源语言对效果更明显。
  • 噪声微调在所有翻译方向上均提升性能,最优噪声比例因语言对而异,表明其具有方向特异性鲁棒性优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。