[论文解读] MAM: Masked Acoustic Modeling for End-to-End Speech-to-Text Translation
本文提出掩码语音建模(MAM),一种自监督预训练技术,可在无需转录语音数据的情况下实现端到端语音到文本翻译(E2E-ST)。MAM 训练语音编码器利用上下文信息重建被掩码的语音片段,在无任何转录数据的情况下,平均 BLEU 提升 +2.3,即使在音乐或动物叫声等非语音音频上进行预训练,性能仍能提升。
End-to-end Speech-to-text Translation (E2E-ST), which directly translates source language speech to target language text, is widely useful in practice, but traditional cascaded approaches (ASR+MT) often suffer from error propagation in the pipeline. On the other hand, existing end-to-end solutions heavily depend on the source language transcriptions for pre-training or multi-task training with Automatic Speech Recognition (ASR). We instead propose a simple technique to learn a robust speech encoder in a self-supervised fashion only on the speech side, which can utilize speech data without transcription. This technique termed Masked Acoustic Modeling (MAM), not only provides an alternative solution to improving E2E-ST, but also can perform pre-training on any acoustic signals (including non-speech ones) without annotation. We conduct our experiments over 8 different translation directions. In the setting without using any transcriptions, our technique achieves an average improvement of +1.1 BLEU, and +2.3 BLEU with MAM pre-training. Pre-training of MAM with arbitrary acoustic signals also has an average improvement with +1.6 BLEU for those languages. Compared with ASR multi-task learning solution, which replies on transcription during training, our pre-trained MAM model, which does not use transcription, achieves similar accuracy.
研究动机与目标
- 解决现有端到端语音到文本翻译(E2E-ST)模型在预训练或多任务学习中对大规模转录语音数据的依赖问题。
- 开发一种自监督方法,利用原始未转录的语音及任意声学信号(如音乐、动物叫声)对鲁棒语音编码器进行预训练。
- 证明无需转录数据的预训练可达到或超越依赖转录数据的方法(如 ASR 多任务学习)的性能。
- 在转录数据不可用或成本过高的低资源和零资源场景下,实现有效的预训练。
提出的方法
- 在预训练过程中,MAM 对输入语音谱图的随机片段进行掩码,并训练模型利用上下文信息重建原始被掩码的片段。
- 重建目标仅作用于语音模态,无需任何文本或转录监督。
- 预训练后的 MAM 模型可端到端微调用于语音到文本翻译,无需在转录数据上进行额外微调。
- MAM 与任何 E2E-ST 模型架构兼容,可与现有预训练或多任务学习策略结合使用。
- 该方法具有通用性:可在任意声学信号上进行预训练(如多语言语音、音乐、动物叫声),而不仅限于人类语音。
- 模型采用标准的序列到序列框架,结合掩码重建目标,通过最小化预测与原始被掩码语音帧之间的 MSE 损失进行训练。
实验结果
研究问题
- RQ1一种不依赖转录数据的自监督语音预训练方法,能否提升端到端语音到文本翻译的性能?
- RQ2MAM 预训练在音乐或动物叫声等非语音声学信号上的泛化能力如何?
- RQ3与依赖转录数据的预训练方法(如 ASR 预训练或多任务学习)相比,MAM 在翻译准确率方面表现如何?
- RQ4在无任何转录数据的低资源或零资源场景下,MAM 是否能实现优异性能?
- RQ5MAM 预训练是否能减少对昂贵转录数据的依赖,同时保持或提升翻译质量?
主要发现
- 在零转录设置下,MAM 在 8 个翻译方向上的平均 BLEU 提升达 +1.09,优于基线模型。
- 采用 MAM 预训练后,模型在无任何转录数据的情况下,平均 BLEU 提升达 +2.26,显著优于基线模型。
- 当在任意声学信号(如音乐、动物叫声)上进行预训练时,MAM 仍实现平均 BLEU 提升 +1.6,证明其在人类语音之外也具备良好泛化能力。
- 在低资源设置下(50 小时训练数据),在无转录数据的 Libri-Light 上预训练的 MAM 模型,性能可与经过 ASR 多任务学习微调的模型相媲美。
- 即使仅使用 50 小时训练数据且微调阶段无转录数据,MAM 在非语音音频上预训练的模型在法语到英语翻译任务中仍达到 6.84 BLEU,优于基线 E2E-ST 模型(0.52 BLEU)。
- 使用英语数据进行 MAM 预训练可将英语到法语翻译的性能提升至 31.2 BLEU(基线为 28.9),表明即使在极少量监督下,MAM 也能带来显著性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。