Skip to main content
QUICK REVIEW

[论文解读] A comparison of recent waveform generation and acoustic modeling methods for neural-network-based speech synthesis

Xin Wang, Jaime Lorenzo-Trueba|arXiv (Cornell University)|Apr 7, 2018
Speech Recognition and Synthesis参考文献 14被引用 7
一句话总结

本文在大规模众包评估的统一TTS框架下,对比了近期基于神经网络的声学模型与声码器。结果表明,自回归(AR)声学模型优于标准RNN和基于GAN的后处理滤波器,而WaveNet声码器相较于传统源-滤波声码器显著提升了语音质量,AR + WaveNet组合的语音质量接近人工编码语音质量。

ABSTRACT

Recent advances in speech synthesis suggest that limitations such as the lossy nature of the amplitude spectrum with minimum phase approximation and the over-smoothing effect in acoustic modeling can be overcome by using advanced machine learning approaches. In this paper, we build a framework in which we can fairly compare new vocoding and acoustic modeling techniques with conventional approaches by means of a large scale crowdsourced evaluation. Results on acoustic models showed that generative adversarial networks and an autoregressive (AR) model performed better than a normal recurrent network and the AR model performed best. Evaluation on vocoders by using the same AR acoustic model demonstrated that a Wavenet vocoder outperformed classical source-filter-based vocoders. Particularly, generated speech waveforms from the combination of AR acoustic model and Wavenet vocoder achieved a similar score of speech quality to vocoded speech.

研究动机与目标

  • 建立一个公平、大规模的评估框架,用于比较现代神经TTS组件。
  • 研究先进声学建模技术(特别是自回归与基于GAN的模型)对语音质量的影响。
  • 评估基于深度学习的声码器(尤其是WaveNet)与经典源-滤波声码器的性能。
  • 识别出实现高保真语音合成的最优声学模型与声码器组合。
  • 分析波形相位建模与相位恢复在感知质量中的作用。

提出的方法

  • 构建了一个统一的TTS流程,采用标准SPSS后端,共享前端与持续时间建模模块。
  • 对比了四种声学模型:标准RNN、浅层自回归RNN(SAR),以及两种基于GAN的后处理滤波网络(SGA、RGA),分别应用于RNN与SAR输出。
  • 评估了四种声码器:WORLD、PML、Griffin-Lim配合WORLD,以及WaveNet;所有声码器均使用SAR模型的相同声学特征。
  • 通过235名母语为日语的听众参与的大规模众包听力测试,评估语音质量与说话人相似度。
  • 统计分析采用未配对t检验,并使用Holm-Bonferroni校正方法比较各系统之间的平均得分。
  • 分析了谱特征与时间特征(如全局方差与调制谱)以解释感知差异。

实验结果

研究问题

  • RQ1自回归与基于GAN的声学模型在语音质量与自然度方面,相较于标准RNN表现如何?
  • RQ2WaveNet声码器在感知质量方面是否优于WORLD与PML等经典源-滤波声码器?
  • RQ3先进声学模型与WaveNet声码器的组合能否实现与人工编码语音质量相当的语音质量?
  • RQ4在使用传统声码器时,通过Griffin-Lim实现的相位恢复对语音质量有何影响?
  • RQ5为何基于GAN的后处理滤波器尽管提升了谱细节,却仍无法超越自回归模型?

主要发现

  • 自回归(SAR)声学模型在所有声学模型中取得了最高的语音质量得分(3.03),显著优于RNN(2.53)、SGA(2.82)与RGA(2.81)。
  • RNN模型表现出过度平滑效应,表现为生成的MGC特征全局方差低于其他模型。
  • WaveNet声码器显著优于所有其他声码器,SAR-Wa在语音质量上达到最高分,部分情况下甚至优于48 kHz人工编码语音。
  • SAR声学模型与WaveNet声码器的组合产生的语音质量非常接近人工编码语音质量,表明已接近理想性能。
  • 使用Griffin-Lim算法进行相位恢复并未提升质量,甚至可能引入失真,表现为SAR-Pr与SAR-Wo之间得分无显著差异。
  • 基于GAN的后处理滤波器(SGA、RGA)虽提升了谱细节与全局方差,但引入了更多失真,导致感知质量低于自回归模型,尽管其谱特征更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。