[论文解读] Boosting Noise Robustness of Acoustic Model via Deep Adversarial Training
本文提出一种深度对抗训练框架,通过联合优化生成对抗网络(GAN)与基于神经网络的声学模型(AM),提升自动语音识别(ASR)在噪声环境下的鲁棒性。通过在对抗训练下利用 GAN 从含噪输入生成干净语音特征,该方法在 CHiME-4 开发集上实现 23.38% 的相对错误率降低,在测试集上实现 11.54% 的降低,优于标准交叉熵训练和基线系统,且无需额外的语音增强前端。
In realistic environments, speech is usually interfered by various noise and reverberation, which dramatically degrades the performance of automatic speech recognition (ASR) systems. To alleviate this issue, the commonest way is to use a well-designed speech enhancement approach as the front-end of ASR. However, more complex pipelines, more computations and even higher hardware costs (microphone array) are additionally consumed for this kind of methods. In addition, speech enhancement would result in speech distortions and mismatches to training. In this paper, we propose an adversarial training method to directly boost noise robustness of acoustic model. Specifically, a jointly compositional scheme of generative adversarial net (GAN) and neural network-based acoustic model (AM) is used in the training phase. GAN is used to generate clean feature representations from noisy features by the guidance of a discriminator that tries to distinguish between the true clean signals and generated signals. The joint optimization of generator, discriminator and AM concentrates the strengths of both GAN and AM for speech recognition. Systematic experiments on CHiME-4 show that the proposed method significantly improves the noise robustness of AM and achieves the average relative error rate reduction of 23.38% and 11.54% on the development and test set, respectively.
研究动机与目标
- 解决背景噪声和混响导致的 ASR 性能下降问题。
- 克服传统前端语音增强方法的局限性,包括高计算成本、硬件需求以及因损失函数不匹配导致的语音失真。
- 直接提升声学模型的噪声鲁棒性,无需依赖独立的增强处理流程。
- 探索在端到端 ASR 中使用对抗训练实现噪声鲁棒性的可行性和有效性。
- 通过联合优化生成器、判别器和声学模型,实现更好的泛化能力和性能。
提出的方法
- 使用条件生成对抗网络(cGAN)从含噪输入生成干净语音特征表示。
- 生成器通过学习生成能欺骗判别器(用于区分真实干净信号与生成信号)的逼真干净特征进行训练。
- 声学模型与 GAN 通过结合交叉熵损失与对抗损失的混合损失函数进行联合优化,损失权重由超参数 α 控制。
- 训练目标被形式化为极小化-极大化博弈:min_G max_D V(G,D) = E_x~p_data[log D(x)] + E_z~p_z[log(1 - D(G(z)))]
- 该框架避免了干净与含噪语音对之间的一一对应关系,且无需显式语音增强模块。
- 方法采用 PyTorch 实现端到端训练,声学模型通过反向传播经由 GAN 生成器和判别器进行优化。
实验结果
研究问题
- RQ1对抗训练能否在无需独立语音增强前端的情况下有效提升声学模型的噪声鲁棒性?
- RQ2在噪声环境下,GAN 与声学模型的联合优化相较于标准交叉熵训练,在 ASR 性能上表现如何?
- RQ3在实现最佳 ASR 性能时,对抗损失与分类损失之间的最优权衡(由 α 控制)是什么?
- RQ4对抗训练是否相比标准训练能实现更快收敛和更高帧级准确率?
- RQ5所提方法在推理阶段无需干净参考信号的情况下,能否在真实世界噪声条件下实现良好泛化?
主要发现
- 所提深度对抗训练方法在 CHiME-4 开发集上相比基线系统实现 23.38% 的相对错误率降低。
- 在测试集上,该方法实现 11.54% 的相对错误率降低,表明其在真实世界噪声条件下的强泛化能力。
- 当 α = 0.4 时,模型在开发集上达到最低 WER(16.32%),表明对抗损失与分类损失之间达到最佳平衡。
- 与交叉熵训练相比,对抗训练设置下帧准确率提升更快且达到更高水平。
- 在所有测试条件下,该方法均优于标准交叉熵训练模型(CE-train)和基线 Kaldi 系统。
- 结果表明,端到端对抗训练能有效捕捉噪声语音的结构特征,并在无需显式语音增强的情况下提升鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。