Skip to main content
QUICK REVIEW

[论文解读] Perceptual Loss with Recognition Model for Single-Channel Enhancement and Robust ASR

Peter Plantinga, Deblin Bagchi|arXiv (Cornell University)|Dec 11, 2021
Speech and Audio Processing被引用 8
一句话总结

本文提出一种基于预训练语音模型的感知损失,以提升单通道语音增强在鲁棒自动语音识别(ASR)中的表现。通过利用语音结构意识而非原始频谱能量,该方法在保持最先进增强性能的同时减少失真,在 Voicebank+DEMAND 数据集上实现 2.80% 的 WER,相较于联合训练相对提升超过 20%,相较于与失真无关的训练方法相对提升 14%。

ABSTRACT

Single-channel speech enhancement approaches do not always improve automatic recognition rates in the presence of noise, because they can introduce distortions unhelpful for recognition. Following a trend towards end-to-end training of sequential neural network models, several research groups have addressed this problem with joint training of front-end enhancement module with back-end recognition module. While this approach ensures enhancement outputs are helpful for recognition, the enhancement model can overfit to the training data, weakening the recognition model in the presence of unseen noise. To address this, we used a pre-trained acoustic model to generate a perceptual loss that makes speech enhancement more aware of the phonetic properties of the signal. This approach keeps some benefits of joint training, while alleviating the overfitting problem. Experiments on Voicebank + DEMAND dataset for enhancement show that this approach achieves a new state of the art for some objective enhancement scores. In combination with distortion-independent training, our approach gets a WER of 2.80\% on the test set, which is more than 20\% relative better recognition performance than joint training, and 14\% relative better than distortion-independent mask training.

研究动机与目标

  • 为解决联合语音增强与 ASR 训练中的失真问题,即增强模型在训练数据上过拟合并引入对识别无帮助的失真。
  • 在不进行完整联合训练的情况下提升 ASR 的语音增强性能,同时保持模块化并维持识别性能。
  • 探究基于语音结构的感知损失是否在增强低能量音素和提升识别准确率方面优于传统的频谱损失或 L1 损失。
  • 通过发布一个与 SpeechBrain 兼容的配方和预训练模型,证明该方法的通用性和可复现性。
  • 在公开数据集上直接对比感知损失训练与联合训练及与失真无关的训练方法。

提出的方法

  • 该方法使用预训练的语音模型生成感知损失,指导增强网络输出保留语音内容,特别是低能量音素。
  • 感知损失计算为预训练语音模型在干净语音和增强语音下的隐藏层激活之间的 L1 距离,鼓励增强网络模仿干净语音的表征。
  • 增强模型采用混合损失进行训练,结合该感知损失与标准的 L1 频谱幅度损失,以平衡感知保真度与信号重建。
  • 该方法在 Voicebank+DEMAND 数据集上进行评估,使用客观增强指标和端到端 ASR 性能,其中识别模型在含噪数据上进行训练。
  • 探索了在感知模型中使用局部上下文窗口的变体,表现出更优性能,并在 CHiME-2 上达到当前最先进水平。
  • 该方法在 SpeechBrain 工具包中实现,提供公开配方和预训练模型,以确保可复现性和可重用性。

实验结果

研究问题

  • RQ1与联合训练或与失真无关的训练相比,使用预训练语音模型生成感知损失是否能提升语音增强在鲁棒 ASR 中的表现?
  • RQ2与高能量音素相比,感知损失如何影响低能量音素的识别?
  • RQ3基于语音结构的感知损失是否能减少增强网络引入的、损害识别性能的失真?
  • RQ4感知模型中的哪些架构选择(如上下文大小、输入类型)对增强质量与识别准确率影响最大?
  • RQ5所提方法是否能在保持模块化与可复现性的同时,同时在客观增强指标与端到端 ASR 上实现最先进性能?

主要发现

  • 所提感知损失方法在 Voicebank+DEMAND 数据集上实现 2.80% 的测试 WER,相较于联合训练相对提升超过 20%,相较于与失真无关的训练方法相对提升 14%。
  • 该方法在 Voicebank+DEMAND 上实现了最先进客观增强指标,CSIG 为 4.40,COVL 为 3.75,CBAK 为 3.52,优于大多数先前方法在感知相关指标上的表现。
  • 感知损失在保留低能量音素方面尤为有效,因为损失聚焦于语音结构而非能量差异,而后者常被传统频谱损失扭曲。
  • 在感知模型中使用局部上下文窗口可提升性能,并在 CHiME-2 上匹配当前最先进识别得分,证明了该方法的鲁棒性与适应性。
  • 即使识别模型仅在含噪数据上进行训练,添加感知损失仍可将测试集 WER 从 3.43% 降低至 3.34%,表明增强输出中的失真减少。
  • 该方法通过解耦增强与识别训练,成功避免了联合训练中常见的过拟合问题,同时仍能引导增强过程朝向对识别友好的输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。