[论文解读] Multilingual Speech-to-Speech Translation into Multiple Target Languages
该论文提出了首个支持多种目标语言的多语言语音到语音翻译系统,采用带有语言特异性单元掩码的语音到掩码单元(S2MU)模型,以及带有语言嵌入和辅助语言识别损失的多语言语音合成器(vocoder)。该方法在将英语翻译为16种目标语言时,在域内数据上相比双语基线模型平均提升+5.2 BLEU,在域外数据上提升+2.7 BLEU。
Speech-to-speech translation (S2ST) enables spoken communication between people talking in different languages. Despite a few studies on multilingual S2ST, their focus is the multilinguality on the source side, i.e., the translation from multiple source languages to one target language. We present the first work on multilingual S2ST supporting multiple target languages. Leveraging recent advance in direct S2ST with speech-to-unit and vocoder, we equip these key components with multilingual capability. Speech-to-masked-unit (S2MU) is the multilingual extension of S2U, which applies masking to units which don't belong to the given target language to reduce the language interference. We also propose multilingual vocoder which is trained with language embedding and the auxiliary loss of language identification. On benchmark translation testsets, our proposed multilingual model shows superior performance than bilingual models in the translation from English into $16$ target languages.
研究动机与目标
- 实现支持多种目标语言的多语言语音到语音翻译,突破以往仅关注多语言源语言而单一目标语言的研究局限。
- 解决在单一S2ST模型中整合多种语言时产生的语言干扰和单元词汇量增加的问题。
- 通过引入带有语言嵌入和辅助语言识别损失的多语言语音合成器,提升可扩展性和性能。
- 通过共享的多语言建模实现跨语言知识迁移,尤其有助于低资源语言的性能提升。
提出的方法
- 提出一种语音到掩码单元(S2MU)模型,在预测单元时对不属于目标语言的单元进行掩码,从而在单元预测过程中减少跨语言干扰。
- 引入一种使用语言嵌入和辅助语言识别损失进行训练的多语言语音合成器,以提升在多种目标语言上的泛化能力。
- 使用预训练的HuBERT模型从目标语音中提取离散单元,并将各语言的单元词典拼接以实现多语言建模。
- 端到端训练S2U模型,使用掩码单元以在翻译过程中聚焦于相关的目标语言特异性单元。
- 采用两阶段训练流程:首先使用掩码单元训练S2MU模型,然后使用预测的单元和语言标识符训练多语言语音合成器。
- 使用ASR-BLEU作为评估指标,即通过预训练的ASR模型将生成的语音转录为文本,并与参考文本进行比较。

实验结果
研究问题
- RQ1单一多语言模型能否有效支持对多种目标语言的语音到语音翻译,而不仅限于多源语言?
- RQ2在共享的S2U模型中整合多种语言的单元词典时,如何缓解语言干扰问题?
- RQ3通过语言嵌入和辅助语言识别损失训练的多语言语音合成器,能否提升在多样化目标语言上的语音合成质量和翻译性能?
- RQ4多语言S2ST中的跨语言知识迁移是否带来性能增益,尤其是在低资源场景下?
- RQ5模型容量选择(如S2U与无文本模型)如何与语言资源可用性相互作用,进而影响翻译性能?
主要发现
- 所提出的多语言S2ST模型在16种目标语言的域内测试集上,相比使用单语语音合成器的双语S2U基线模型,平均BLEU提升+5.2。
- 在域外数据上,多语言模型相比双语基线模型平均BLEU提升+2.7,表明对领域偏移具有更强鲁棒性。
- S2MU模型搭配多语言语音合成器在域内和域外测试集上分别比双语Textless模型提升+1.1和+1.6 BLEU。
- 多语言语音合成器通过降低重合成过程中的WER,提升了翻译性能,尤其在高资源方向(如en-es)提升最明显,使用S2MU时BLEU提升+2.0。
- 多语言模型的性能与S2MU推理质量高度相关;例如斯洛伐克语(sk)的WER降低5%,但BLEU增益有限,原因在于单元质量较低。
- 在低资源方向(如et, fi, lt)所有模型性能均表现不佳,表明即使采用多语言训练,数据稀缺仍是主要瓶颈。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。