[论文解读] Towards achieving robust universal neural vocoding
该论文提出了一种基于WaveRNN的说话人无关神经声码器,其在涵盖17种语言的74位不同说话人的数据上进行训练,无需显式说话人编码即可在高质量录音上实现98%的相对MUSHRA得分。该模型在未见说话人、语言、歌唱及非语音发声方面表现出稳健的泛化能力,即使在低质量或分布外条件下也优于说话人相关声码器,但在噪声或极端发声条件下质量有所下降。
This paper explores the potential universality of neural vocoders. We train a WaveRNN-based vocoder on 74 speakers coming from 17 languages. This vocoder is shown to be capable of generating speech of consistently good quality (98% relative mean MUSHRA when compared to natural speech) regardless of whether the input spectrogram comes from a speaker or style seen during training or from an out-of-domain scenario when the recording conditions are studio-quality. When the recordings show significant changes in quality, or when moving towards non-speech vocalizations or singing, the vocoder still significantly outperforms speaker-dependent vocoders, but operates at a lower average relative MUSHRA of 75%. These results are shown to be consistent across languages, regardless of them being seen during training (e.g. English or Japanese) or unseen (e.g. Wolof, Swahili, Ahmaric).
研究动机与目标
- 探究神经声码器是否能在不使用显式说话人编码的情况下实现通用鲁棒性。
- 评估在未见说话人、语言和发声风格(包括歌唱和非语音发声)下的泛化能力。
- 确定在多样化、多说话人、多语言数据上进行训练是否能实现比说话人相关模型更好的泛化性能。
- 评估在降质录音条件(如噪声、混响和低质量)下的性能表现。
- 探索神经声码器在标准TTS场景之外的泛化极限。
提出的方法
- 在来自17种语言的74位说话人数据上训练了一个基于WaveRNN的声码器(RNN_MS),以梅尔谱图作为输入,预测10比特mu-law波形样本。
- 使用双向GRU条件网络处理梅尔谱图,使用单向GRU进行自回归波形生成。
- 在训练过程中未使用任何说话人嵌入或独热编码,完全依赖谱图条件进行建模。
- 在多种配置下评估模型:说话人相关(SD)、多说话人(3Spk、7Spk)和通用(Univ)声码器。
- 使用真实录音的最优谱图以隔离声码器性能与谱图估计误差的影响。
- 采用MUSHRA评分对合成语音质量与自然语音在多样化条件下的表现进行定量比较。
实验结果
研究问题
- RQ1神经声码器是否能在不使用显式说话人编码的情况下实现高质量、通用的语音合成?
- RQ2在多样化说话人和语言上训练的声码器,对未见说话人和语言的泛化能力如何?
- RQ3在降质录音条件下(如噪声、混响、低质量)下,通用声码器的性能表现如何?
- RQ4声码器在处理非语音发声(如呻吟、呼喊)以及歌唱时表现如何,特别是在语音质量失真或复杂的情况下?
- RQ5与说话人相关模型相比,在多样化数据上进行训练在多大程度上提升了泛化能力?
主要发现
- 无论训练时是否见过该说话人或语言,通用声码器在高质量录音上均实现了98%的相对MUSHRA得分。
- 在未见场景(如非语音发声)中,声码器平均获得72%的相对MUSHRA得分,显著优于说话人相关模型。
- 对于歌唱,干净的抒情歌曲达到94.5%的相对MUSHRA得分,而失真风格(如摇滚)则降至39.3%,表明对语音质量敏感。
- 在噪声或混响条件下性能下降至78%的相对MUSHRA得分,在噪声与混响同时存在时进一步降至58%。
- 声码器在已见和未见语言(包括沃洛夫语、斯瓦希里语和阿姆哈拉语)中均表现出一致性能,表明具备强大的跨语言泛化能力。
- 在低质量输入中出现了如震音效果和类语音噪声伪影等失真,表明其在建模非语音声学特性方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。