[论文解读] Transfer Learning from Monolingual ASR to Transcription-free Cross-lingual Voice Conversion
本文提出了一种无需转录的跨语言语音转换方法,利用单语自动语音识别(ASR)模型的迁移学习来对齐不同语言之间的内容。通过使用预训练的ASR模型从源语言语音中提取语音特征,并训练一个Seq2Seq模型以直接预测目标梅尔倒谱图,该方法在无需平行数据或转录的情况下实现了说话人相关的语音转换,在VCC 2020数据集上取得了3.83(质量)和3.54(相似度)的MOS评分。
Cross-lingual voice conversion (VC) is a task that aims to synthesize target voices with the same content while source and target speakers speak in different languages. Its challenge lies in the fact that the source and target data are naturally non-parallel, and it is even difficult to bridge the gaps between languages with no transcriptions provided. In this paper, we focus on knowledge transfer from monolin-gual ASR to cross-lingual VC, in order to address the con-tent mismatch problem. To achieve this, we first train a monolingual acoustic model for the source language, use it to extract phonetic features for all the speech in the VC dataset, and then train a Seq2Seq conversion model to pre-dict the mel-spectrograms. We successfully address cross-lingual VC without any transcription or language-specific knowledge for foreign speech. We experiment this on Voice Conversion Challenge 2020 datasets and show that our speaker-dependent conversion model outperforms the zero-shot baseline, achieving MOS of 3.83 and 3.54 in speech quality and speaker similarity for cross-lingual conversion. When compared to Cascade ASR-TTS method, our proposed one significantly reduces the MOS drop be-tween intra- and cross-lingual conversion.
研究动机与目标
- 解决当源语言和目标语言非平行且无转录文本时,跨语言语音转换中内容不匹配的挑战。
- 探索从单语ASR模型迁移知识,以改善零样本跨语言语音转换中的对齐与合成性能。
- 在不依赖语言特定或基于转录监督的前提下,缩小语音转换在语言内与跨语言之间的性能差距。
- 开发一种仅依赖源语言ASR模型声学特征即可在不同语言间泛化的说话人相关语音转换系统。
提出的方法
- 在源语言上训练一个单语ASR模型,以从数据集中所有语音中提取语音嵌入。
- 使用训练好的ASR模型为源语音和目标语音生成内容对齐的语音表示,实现跨语言对齐。
- 将提取的语音特征输入Seq2Seq架构,直接从源语音预测目标说话人的梅尔倒谱图。
- 仅使用声学特征和目标说话人嵌入端到端训练Seq2Seq模型,无需转录或语言特定模型。
- 在推理阶段应用说话人相关条件,以在合成语音中保留目标说话人的身份特征。
- 使用VCC 2020数据集进行评估,并与零样本及级联ASR-TTS基线方法进行性能比较。
实验结果
研究问题
- RQ1单语ASR模型是否能有效用于在无转录的情况下在语音转换中实现跨语言的内容表征迁移?
- RQ2与零样本或级联方法相比,从ASR迁移知识在多大程度上提升了跨语言语音转换的性能?
- RQ3从源语言ASR模型中提取的语音特征在多大程度上能够实现在目标语言中的内容保持型语音转换?
- RQ4与现有方法相比,所提出的方法是否显著降低了语言内与跨语言转换之间的MOS下降?
主要发现
- 所提方法在VCC 2020数据集上的跨语言语音转换中,语音质量的平均意见分(MOS)为3.83,说话人相似度MOS为3.54。
- 该模型在语音质量和说话人相似度方面均优于零样本基线,证明了单语ASR迁移的有效性。
- 与级联ASR-TTS方法相比,该方法显著降低了语言内与跨语言转换之间的MOS下降,表明泛化能力更强。
- 该方法成功实现了无需平行数据、转录或语言特定模型的说话人相关语音转换。
- 从源语言ASR模型中提取的语音特征足以提供跨语言对齐所需的内容表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。