Skip to main content
QUICK REVIEW

[论文解读] Noise Robust TTS for Low Resource Speakers using Pre-trained Model and Speech Enhancement

Dongyang Dai, Li Chen|arXiv (Cornell University)|May 26, 2020
Speech Recognition and Synthesis参考文献 24被引用 8
一句话总结

该论文提出了一种针对低资源说话人的噪声鲁棒文本到语音(TTS)框架,通过将说话人嵌入和梅尔频谱图去噪掩码作为条件输入,独立建模说话人和噪声特性。该模型在多说话人干净与噪声数据上进行预训练,能够适应低质量新说话人,并合成高质量的干净语音,在主观评估中相比基线微调方法在去噪数据上的平均意见得分(MOS)高出0.115分。

ABSTRACT

With the popularity of deep neural network, speech synthesis task has achieved significant improvements based on the end-to-end encoder-decoder framework in the recent days. More and more applications relying on speech synthesis technology have been widely used in our daily life. Robust speech synthesis model depends on high quality and customized data which needs lots of collecting efforts. It is worth investigating how to take advantage of low-quality and low resource voice data which can be easily obtained from the Internet for usage of synthesizing personalized voice. In this paper, the proposed end-to-end speech synthesis model uses both speaker embedding and noise representation as conditional inputs to model speaker and noise information respectively. Firstly, the speech synthesis model is pre-trained with both multi-speaker clean data and noisy augmented data; then the pre-trained model is adapted on noisy low-resource new speaker data; finally, by setting the clean speech condition, the model can synthesize the new speaker's clean voice. Experimental results show that the speech generated by the proposed approach has better subjective evaluation results than the method directly fine-tuning pre-trained multi-speaker speech synthesis model with denoised new speaker data.

研究动机与目标

  • 为解决从互联网上常见的低质量、低资源语音数据中训练高质量个性化TTS模型的挑战。
  • 在无需为每位新说话人提供高保真数据的前提下,提升TTS系统在嘈杂环境中的鲁棒性。
  • 通过说话人和噪声的条件建模,实现从低资源、噪声语音数据端到端合成干净、自然的语音。
  • 克服固定长度噪声向量的局限性,采用可变长度的梅尔频谱图去噪掩码以实现更精确的噪声表征。

提出的方法

  • TTS模型同时使用说话人嵌入和梅尔频谱图去噪掩码作为条件输入,以解耦说话人身份与噪声特性。
  • 去噪掩码在梅尔频谱图域中计算为干净语音能量与总能量的比值,表示每个频率bin的噪声含量。
  • 模型在干净多说话人数据与噪声增强的多说话人数据组合上进行预训练,以学习鲁棒表征。
  • 在适应阶段,模型使用新说话人的低资源、噪声语音数据进行微调,输入为说话人嵌入和对应的噪声掩码。
  • 推理时,模型使用全为1的干净掩码,从相同的说话人嵌入生成干净语音。
  • 说话人嵌入从预训练的说话人识别模型中提取,以确保说话人身份的一致性。

实验结果

研究问题

  • RQ1梅尔频谱图去噪掩码能否有效表征低信噪比语音中时变噪声,用于TTS条件建模?
  • RQ2在低资源、噪声语音数据上,同时对TTS模型进行说话人嵌入和噪声表征条件建模,是否能提升合成语音质量?
  • RQ3所提出的预训练与适应策略与在去噪数据上直接微调相比,在语音质量与说话人相似性方面表现如何?
  • RQ4使用可变长度噪声掩码在建模复杂、非平稳噪声方面,相较于固定长度噪声向量,优势有多大?

主要发现

  • 所提方法在四个低资源说话人上平均比基线方法提升0.115 MOS分,平均意见得分分别为3.424(本方法)与3.313(基线)。
  • 语音增强模型在-5 dB信噪比下达到3.787 dB的SI-SDR,0 dB下为7.154 dB,5 dB下为8.694 dB,表明具有有效的降噪能力。
  • 合成语音与训练数据中说话人嵌入的余弦相似度保持较高水平(平均0.865),表明在噪声和低资源条件下仍能保持说话人身份的一致性。
  • 使用梅尔频谱图去噪掩码使模型能够随着掩码从噪声状态过渡到干净状态,平滑地生成从噪声到干净的语音。
  • 主观评估证实,所提方法减少了因去噪数据中信息丢失导致的语音不稳定性,该问题在基线模型中较为明显。
  • 该模型仅使用少量(几分钟)低质量、噪声语音,即可成功为新说话人合成干净语音,展现出在低资源数据上的强大泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。