[论文解读] A Vocoder-free WaveNet Voice Conversion with Non-Parallel Data
该论文提出了一种无需声码器的基于WaveNet的语音转换系统,可直接将与说话人无关的语音后验gram(PPGs)映射到原始波形样本,从而避免了中间声码器特征的使用。通过跳过参数化声码器并避免特征不匹配,该方法在基线方法中显著提升了语音质量,主观评估显示其在感知质量和说话人相似度方面表现更优。
In a typical voice conversion system, vocoder is commonly used for speech-to-features analysis and features-to-speech synthesis. However, vocoder can be a source of speech quality degradation. This paper presents a vocoder-free voice conversion approach using WaveNet for non-parallel training data. Instead of dealing with the intermediate features, the proposed approach utilizes the WaveNet to map the Phonetic PosteriorGrams (PPGs) to the waveform samples directly. In this way, we avoid the estimation errors caused by vocoder and feature conversion. Additionally, as PPG is assumed to be speaker independent, the proposed method also reduces the feature mismatch problem in WaveNet vocoder based approaches. Experimental results conducted on the CMU-ARCTIC database show that the proposed approach significantly outperforms the baseline approaches in terms of speech quality.
研究动机与目标
- 消除语音转换中对参数化声码器的依赖,以避免因特征估计误差导致的语音质量下降。
- 通过使用与说话人无关的PPGs作为输入,解决基于WaveNet声码器的语音转换系统中的特征不匹配问题。
- 实现在无需源说话人与目标说话人间平行训练数据的端到端语音转换。
- 通过使用条件WaveNet直接从PPGs生成原始波形,提升语音质量。
- 在实现高感知质量的同时保持说话人身份特征。
提出的方法
- 该方法使用语音后验gram(PPGs)作为与说话人无关的声学特征,通过预训练模型从源语音中提取。
- 训练一个条件WaveNet,直接从PPGs生成原始波形样本,将PPGs作为局部条件输入。
- 该模型学习从PPGs到时域语音样本的映射,无需任何中间谱特征或声码器阶段。
- 训练过程不需要源-目标语音对的平行数据;每个说话人仅需单语种语音数据。
- WaveNet架构采用空洞因果卷积、门控激活单元和残差连接,以建模长程时间依赖性。
- 使用Adam优化器进行训练,固定初始学习率为0.0001,小批量大小为15,000,训练步数为200,000步,波形振幅采用16位μ-law编码。
实验结果
研究问题
- RQ1无声码器的语音转换系统是否能实现比传统基于WaveNet声码器的方法更高的语音质量?
- RQ2使用与说话人无关的PPGs作为输入,是否能减少基于WaveNet的语音转换中的特征不匹配问题?
- RQ3直接从PPGs生成波形是否能优于依赖中间谱特征和声码器的系统?
- RQ4与基线GMM和WaveNet系统相比,该方法在语音质量和说话人相似度方面的表现如何?
- RQ5在无需源说话人与目标说话人间平行训练数据的情况下,是否可行训练出高质量的语音转换系统?
主要发现
- 所提出的WaveNet-VC方法在所有测试对上的平均RMSE为13.73 dB,优于WaveNet-PPG基线(14.61 dB),并与GMM-WaveNet基线相比表现出具有竞争力的性能。
- 主观质量偏好测试显示,WaveNet-VC显著优于WaveNet-PPG和GMM-WaveNet基线,p值表明具有统计显著性。
- 在说话人相似度偏好测试中,WaveNet-VC显著优于WaveNet-PPG,但在说话人身份保持方面与GMM-WaveNet或GMM(GV)-WaveNet相比无显著差异。
- 尽管未使用传统声码器,该方法仍实现了更优的感知语音质量,证明了从PPGs直接生成波形的有效性。
- 由于省去了参数化声码器,减少了伪影和估计误差,使转换后的语音更加清晰自然。
- 该系统在语音质量优于基于声码器的基线的同时,仍保持了较高的说话人相似度,表明在质量与身份保持之间实现了有利的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。