[论文解读] DenoiSpeech: Denoising Text to Speech with Frame-Level Noise Modeling
DenoiSpeech 提出了一种文本到语音系统,通过使用联合训练的噪声条件模块对帧级噪声进行建模,从嘈杂的训练数据中合成高质量、清晰的语音。在真实世界嘈杂数据上,其性能分别优于使用话语级噪声嵌入或预增强语音的先前方法 0.31 和 0.66 MOS,证明了其在复杂噪声环境下的优越鲁棒性和感知质量。
While neural-based text to speech (TTS) models can synthesize natural and intelligible voice, they usually require high-quality speech data, which is costly to collect. In many scenarios, only noisy speech of a target speaker is available, which presents challenges for TTS model training for this speaker. Previous works usually address the challenge using two methods: 1) training the TTS model using the speech denoised with an enhancement model; 2) taking a single noise embedding as input when training with noisy speech. However, they usually cannot handle speech with real-world complicated noise such as those with high variations along time. In this paper, we develop DenoiSpeech, a TTS system that can synthesize clean speech for a speaker with noisy speech data. In DenoiSpeech, we handle real-world noisy speech by modeling the fine-grained frame-level noise with a noise condition module, which is jointly trained with the TTS model. Experimental results on real-world data show that DenoiSpeech outperforms the previous two methods by 0.31 and 0.66 MOS respectively.
研究动机与目标
- 为解决在仅能获取目标说话人嘈杂语音数据时训练高质量文本到语音模型的挑战。
- 克服先前方法的局限性,这些方法使用粗粒度的话语级噪声嵌入或预增强语音,在复杂、时变噪声下表现不佳。
- 通过建模细粒度、时变的噪声模式,提升在真实世界嘈杂环境下的语音合成质量。
- 通过对抗性 CTC 损失确保噪声提取器仅学习噪声信息,而非语音内容,防止语义信息泄露。
提出的方法
- DenoiSpeech 使用修改后的 FastSpeech 2 架构,其中噪声条件模块将帧级噪声信息注入 TTS 解码器。
- 噪声条件模块包含一个基于 UNet 的噪声提取器,利用配对和非配对训练数据从嘈杂语音输入中分离出背景噪声。
- 噪声编码器将提取的噪声转换为潜在表征,并将其与 TTS 模型中的隐藏状态拼接,以基于噪声特性进行合成条件化。
- 引入对抗性 CTC 模块,通过强制噪声与空白标记对齐,确保噪声提取器仅学习噪声特征,而非语音的音素或语言内容。
- 噪声提取器与 TTS 模型通过多任务损失联合训练,损失函数包括 TTS 损失、基频预测损失和对抗性 CTC 损失,实现端到端优化。
- 推理时,向噪声编码器输入静音,使模型能够生成无背景噪声的清晰语音。
实验结果
研究问题
- RQ1当训练数据为嘈杂且包含复杂、时变噪声时,帧级噪声建模是否能提升文本到语音的质量?
- RQ2与话语级噪声嵌入相比,帧级噪声条件化在感知质量和鲁棒性方面表现如何?
- RQ3将噪声提取器与 TTS 模型联合训练是否能提升在真实世界嘈杂数据上的泛化能力和性能?
- RQ4对抗性 CTC 模块在防止语义信息泄露到噪声表征中的影响是什么?
- RQ5当在无配对干净-噪声参考数据上进行训练时,该方法的有效性如何?
主要发现
- DenoiSpeech 在真实世界嘈杂数据上的平均意见得分(MOS)达到 3.35,优于次佳基线方法(Enhancement-Based)0.66 MOS。
- 在人工嘈杂数据上,DenoiSpeech 的 MOS 达到 3.77,优于 Enhancement-Based 方法 0.31 MOS,也优于 Augment-Adversarial 方法 0.34 MOS。
- 与话语级条件化相比,帧级噪声条件化使合成质量提升 0.59 CMOS,证明了时间粒度的重要性。
- 在 TTS 训练期间固定噪声提取器会使性能下降 0.16 CMOS,证实了联合训练对泛化能力的益处。
- 移除对抗性 CTC 模块会导致 CMOS 下降 0.09,证明其在将纯噪声与语音内容分离方面的有效性。
- 该方法在真实世界数据上的性能增益大于人工数据,表明其对复杂真实世界噪声具有更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。