[论文解读] Linear networks based speaker adaptation for speech synthesis
该论文提出了一种基于线性网络(LN)的神经文本到语音合成说话人自适应方法,在多个层插入LN,并与输出层一起微调。通过采用低秩加对角(LRPD)分解以实现参数效率,该方法在仅使用200个自适应语音样本的情况下,实现了与在1,000个语音样本上训练的说话人相关模型相当的说话人自适应质量,即使在低数据环境下也优于标准微调和完整LN方法。
Speaker adaptation methods aim to create fair quality synthesis speech voice font for target speakers while only limited resources available. Recently, as deep neural networks based statistical parametric speech synthesis (SPSS) methods become dominant in SPSS TTS back-end modeling, speaker adaptation under the neural network based SPSS framework has also became an important task. In this paper, linear networks (LN) is inserted in multiple neural network layers and fine-tuned together with output layer for best speaker adaptation performance. When adaptation data is extremely small, the low-rank plus diagonal(LRPD) decomposition for LN is employed to make the adapted voice more stable. Speaker adaptation experiments are conducted under a range of adaptation utterances numbers. Moreover, speaker adaptation from 1) female to female, 2) male to female and 3) female to male are investigated. Objective measurement and subjective tests show that LN with LRPD decomposition performs most stable when adaptation data is extremely limited, and our best speaker adaptation (SA) model with only 200 adaptation utterances achieves comparable quality with speaker dependent (SD) model trained with 1000 utterances, in both naturalness and similarity to target speaker.
研究动机与目标
- 解决在仅有限目标说话人数据可用时构建高质量、说话人特定语音合成语音的问题。
- 通过在多个层引入线性网络(LN),提升基于深度神经网络的语音合成中的说话人自适应性能。
- 通过应用低秩加对角(LRPD)分解来减少LN参数中的过拟合,从而在极端数据稀缺条件下稳定自适应过程。
- 在多种说话人自适应方向上评估该方法:女声到女声、男声到女声,以及女声到男声。
- 证明基于LN的自适应方法在自然度和说话人相似度方面优于标准微调和完整LN方法,尤其在自适应数据极少时表现更优。
提出的方法
- 将线性网络(LN)集成到多任务DNN-BLSTM声学模型的多个隐藏层中,用于语音合成。
- 在自适应过程中与输出层联合微调LN参数,实现在不重新训练整个网络的情况下实现说话人特定的变换。
- 对LN层应用低秩加对角(LRPD)分解,以减少自由参数的数量,从而在自适应数据稀缺时增强稳定性。
- 利用LRPD分解来约束线性变换矩阵的秩,从而在低数据场景下平衡表达能力与泛化能力。
- 使用语言特征和多输出头(用于梅尔倒谱系数、对数F0、频带非周期性分量及音节状态)训练一个多说话人DNN-BLSTM基础模型。
- 通过仅使用少量目标说话人语音样本对LN层和输出层进行微调,而不修改共享的编码器层。
实验结果
研究问题
- RQ1在DNN-BLSTM TTS模型中于多个层插入线性网络(LN)是否能相比仅在输出层进行微调的标准方法,提升说话人自适应性能?
- RQ2当仅提供少量自适应语音样本时,对LN层应用低秩加对角(LRPD)分解如何影响自适应的稳定性和泛化能力?
- RQ3当仅使用200个自适应语音样本时,基于LN的自适应方法是否能达到在1,000个语音样本上训练的说话人相关(SD)模型所具备的自然度和说话人相似度水平?
- RQ4该方法在具有挑战性的跨说话人自适应方向(如男声到女声、女声到男声)上的表现如何?
- RQ5由于减少了过拟合,LRPD-LN变体是否在低数据环境下比完整LN更具鲁棒性?
主要发现
- LRPD-LN自适应方法在主观评价(自然度和说话人相似度)方面与在1,000个语音样本上训练的说话人相关(SD)模型相当,仅使用200个自适应语音样本。
- 在200个自适应语音样本下,LRPD-LN在客观和主观评估中均优于标准输出层微调和完整LN方法,尤其在低数据环境下表现更优。
- 当自适应数据有限(少于50个语音样本)时,完整LN的性能劣于LRPD-LN,这是由于过多的说话人特异性参数导致过拟合。
- 随着自适应数据量增加(超过100个语音样本),完整LN的性能超越LRPD-LN,表明在数据充足时LRPD约束变得次优。
- 主观测试证实,当数据稀缺时,LRPD-LN比SD和完整LN模型更具稳定性,而SD模型在语音样本数量下降时性能迅速下降。
- 该方法在跨说话人自适应任务中泛化良好,包括男声到女声和女声到男声,LRPD-LN始终优于在相同小样本量下训练的SD模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。