[论文解读] A Cycle-GAN Approach to Model Natural Perturbations in Speech for ASR Applications
本文提出一种基于Cycle-GAN的前端方法,将自然扰动语音(如笑声语音和沙哑语音)转换为正常语音,从而在无需并行训练数据的情况下提升自动语音识别(ASR)的鲁棒性。该方法通过在非并行语音数据上采用循环一致性对抗训练,学习分离扰动,在多个ASR系统中实现了显著的词错误率(WER)降低(最高达21.0%)。
Naturally introduced perturbations in audio signal, caused by emotional and physical states of the speaker, can significantly degrade the performance of Automatic Speech Recognition (ASR) systems. In this paper, we propose a front-end based on Cycle-Consistent Generative Adversarial Network (CycleGAN) which transforms naturally perturbed speech into normal speech, and hence improves the robustness of an ASR system. The CycleGAN model is trained on non-parallel examples of perturbed and normal speech. Experiments on spontaneous laughter-speech and creaky-speech datasets show that the performance of four different ASR systems improve by using speech obtained from CycleGAN based front-end, as compared to directly using the original perturbed speech. Visualization of the features of the laughter perturbed speech and those generated by the proposed front-end further demonstrates the effectiveness of our approach.
研究动机与目标
- 研究自然语音扰动(如笑声和沙哑嗓音)对当前最先进ASR系统的影响。
- 开发一种数据高效型前端,将扰动语音转换为正常语音,且无需并行训练数据。
- 通过循环一致性生成建模,提升ASR对情绪和音质相关扰动的鲁棒性。
- 在多种ASR系统和语音类型上验证所提前端的有效性。
提出的方法
- 采用Cycle-GAN架构,包含两个生成器(G_XY和G_YX)和两个判别器(D_X和D_Y),用于学习扰动语音与正常语音之间的域迁移。
- 生成器使用带有门控卷积和实例归一化的残差块,以建模谱特征和准周期特征(MFBs和APs),从而提升表征学习能力。
- 训练目标结合对抗损失、循环一致性损失和身份损失,以确保语音转换的真实性和一致性。
- 前端将原始音频处理为提取梅尔滤波器组特征(MFBs)和准周期分量(APs),随后将其转换为更接近正常语音分布的表示。
- 模型在笑声语音和沙哑语音数据集的非并行数据上进行训练,实现无需成对样本的零样本域迁移。
实验结果
研究问题
- RQ1基于Cycle-GAN的前端能否有效减轻自然语音扰动(如笑声和沙哑)对ASR性能的负面影响?
- RQ2在梅尔滤波器组特征(MFBs)之外引入准周期分量(APs)对转换后语音的质量和下游ASR准确率有何影响?
- RQ3所提前端在不同ASR系统和语音类型上的泛化能力如何?
- RQ4转换后语音的学得特征在分布和结构上与正常语音相比如何?
主要发现
- 在将笑声语音转换为正常语音时,所提前端使ASpIRE ASR系统的词错误率(WER)降低了21.0%。
- 对于沙哑语音,使用MFBs+APs前端后,Google ASR系统的WER降低了11.0%,IBM ASR系统的WER降低了7.9%。
- 在笑声语音上,Google ASR系统的句错误率(SER)最高降低了22.2%,表明句级识别性能得到提升。
- 即使未使用语言模型,DeepSpeech模型在使用前端后,字符错误率(CER)也降低了15.6%,证实其在低资源场景下的有效性。
- t-SNE可视化结果表明,转换后语音的特征分布与正常语音高度接近,而笑声语音的特征则更为分散且明显不同。
- 梅尔滤波器组输出的箱线图显示,转换后语音的特征与正常语音分布高度一致,验证了前端在保留声学特性方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。