[论文解读] SpeechMatrix: A Large-Scale Mined Corpus of Multilingual Speech-to-Speech Translations
本文介绍了SpeechMatrix(SM),一个从欧洲议会录音中挖掘出的大规模多语言语音到语音翻译语料库,涵盖136种语言对和418,000小时对齐语音。作者仅使用挖掘数据即展示了强大的S2ST性能,表明多语言训练、模型预训练以及Mixture-of-Experts稀疏性可显著提升多个基准上的翻译质量。
We present SpeechMatrix, a large-scale multilingual corpus of speech-to-speech translations mined from real speech of European Parliament recordings. It contains speech alignments in 136 language pairs with a total of 418 thousand hours of speech. To evaluate the quality of this parallel speech, we train bilingual speech-to-speech translation models on mined data only and establish extensive baseline results on EuroParl-ST, VoxPopuli and FLEURS test sets. Enabled by the multilinguality of SpeechMatrix, we also explore multilingual speech-to-speech translation, a topic which was addressed by few other works. We also demonstrate that model pre-training and sparse scaling using Mixture-of-Experts bring large gains to translation performance. The mined data and models are freely available.
研究动机与目标
- 通过创建大规模、免费获取的多语言语音到语音翻译语料库,解决语音到语音翻译(S2ST)中的关键数据稀缺问题。
- 评估在17种语言和136种语言对中挖掘的语音对齐质量与实用性。
- 探索多语言S2ST训练,并展示预训练和稀疏模型扩展(MoE)带来的性能提升。
- 通过共享多语言表征,实现多语言S2ST中的零样本和少样本迁移学习。
提出的方法
- 利用Duquenne等人(2021)提出的多语言语音-文本句子嵌入,从欧洲议会语料库中17种语言的单语语音和文本中挖掘语音到语音对齐。
- 在17种语言上训练多语言HuBERT模型,以提取用于下游S2ST和声码器训练的离散语音单元。
- 构建基于共享编码器-解码器架构的序列到序列模型的多语言语音到语音翻译流水线。
- 应用Mixture-of-Experts(MoE)方法,结合GShard和基础层稀疏性,实现高效模型容量扩展,而推理成本不按比例增加。
- 使用预训练模块(如HuBERT、mBART)以改善低资源场景下的模型初始化和泛化能力。
- 在Europarl-ST、VoxPopuli和FLEURS基准上使用BLEU分数评估模型,并对数据选择和模型架构进行消融研究。
实验结果
研究问题
- RQ1能否利用多语言嵌入从单语语音和文本中有效挖掘大规模多语言语音到语音对齐?
- RQ2与双语训练相比,多语言S2ST训练在零样本和域内性能方面表现如何?
- RQ3模型预训练和Mixture-of-Experts稀疏性在挖掘数据上的S2ST性能提升程度如何?
- RQ4挖掘对齐的质量是否足以支持无需人工标注平行数据的强S2ST性能?
主要发现
- SpeechMatrix包含136种语言对共418,000小时的语音,是迄今为止最大规模的免费多语言S2ST语料库。
- 仅使用挖掘数据训练的双语S2ST模型表现强劲,在Europarl-ST和VoxPopuli上相比基线模型平均BLEU提升+3.8分。
- 使用XM Transformer模型进行多语言训练,在Europarl-ST上相比双语训练提升+7.9 BLEU,在FLEURS上提升+5.1 BLEU。
- 采用GShard(64个专家)的MoE稀疏扩展在Europarl-ST数据集上相比密集模型平均提升+1.0 BLEU,且在域内任务中提升更大。
- 采用MoE-GShard(43亿参数)的全对英语多语言模型相比参数量相同(FLOPs相当)的密集12亿参数模型,在Europarl-ST上提升+0.9 BLEU,在FLEURS上提升+0.2 BLEU。
- 当扩展到全部17种语言时,域外FLEURS任务性能略有下降,表明多语言泛化中存在领域偏移挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。