Skip to main content
QUICK REVIEW

[论文解读] Improving Noise Robustness In Speaker Identification Using A Two-Stage Attention Model

Yanpei Shi, Qiang Huang|arXiv (Cornell University)|Sep 24, 2019
Speech Recognition and Synthesis参考文献 37被引用 4
一句话总结

本文提出一种两阶段注意力机制,通过依次应用频域注意力和时域注意力,提升在噪声环境下的说话人识别鲁棒性。通过先在频域后在时域处理特征,该模型在多种噪声类型和信噪比(SNR)水平下均优于X-向量和ResNet-34等强基线模型,在0 dB SNR的babble噪声下于VoxCeleb1数据集上实现了最高92.0%的识别准确率和4.81%的EER。

ABSTRACT

While the use of deep neural networks has significantly boosted speaker recognition performance, it is still challenging to separate speakers in poor acoustic environments. To improve robustness of speaker recognition system performance in noise, a novel two-stage attention mechanism which can be used in existing architectures such as Time Delay Neural Networks (TDNNs) and Convolutional Neural Networks (CNNs) is proposed. Noise is known to often mask important information in both time and frequency domain. The proposed mechanism allows the models to concentrate on reliable time/frequency components of the signal. The proposed approach is evaluated using the Voxceleb1 dataset, which aims at assessment of speaker recognition in real world situations. In addition three types of noise at different signal-noise-ratios (SNRs) were added for this work. The proposed mechanism is compared with three strong baselines: X-vectors, Attentive X-vector, and Resnet-34. Results on both identification and verification tasks show that the two-stage attention mechanism consistently improves upon these for all noise conditions.

研究动机与目标

  • 解决在噪声声学环境中说话人识别性能下降的挑战。
  • 提升现有深度学习说话人识别模型(如TDNN、CNN)在真实噪声条件下的鲁棒性。
  • 设计一种两阶段注意力机制,以选择性地突出显示噪声语音特征中可靠的时域与频域分量。
  • 研究注意力顺序(先频域后时域 vs. 先时域后频域)以及并行与级联配置对模型性能的影响。
  • 在多种噪声类型和SNR水平下,持续展示对强基线模型的性能提升。

提出的方法

  • 首先应用频域注意力机制,利用自注意力机制为TDNN或CNN特征的频域维度分配权重。
  • 随后应用时域注意力机制,通过学习的注意力层计算帧级权重。
  • 以级联方式处理特征(先频域后时域),以模拟多阶段滤波过程。
  • 将级联配置与并行注意力设置进行比较,其中两个注意力模块独立运行。
  • 在并行设置中引入可学习参数γ,以平衡频域与时域注意力的贡献。
  • 将两阶段注意力模块集成到TDNN和ResNet-34等标准架构中,同时保持端到端训练与AM-Softmax损失。

实验结果

研究问题

  • RQ1与单注意力或基线模型相比,两阶段注意力机制是否能提升在噪声环境下的说话人识别鲁棒性?
  • RQ2在不同噪声条件下,先频域后时域(F-T)与先时域后频域(T-F)的注意力顺序中,哪种配置性能更优?
  • RQ3在噪声鲁棒性与性能方面,并行注意力配置与级联配置相比如何?
  • RQ4在噪声环境下,频域注意力组件相较于时域注意力组件对识别性能的贡献程度有多大?
  • RQ5所提出的注意力机制能否有效集成到现有说话人识别架构(如TDNN和ResNet-34)中?

主要发现

  • 两阶段注意力模型在所有噪声类型和SNR水平下,于识别与验证任务中均持续优于X-向量、注意力X-向量及ResNet-34。
  • 在0 dB SNR的babble噪声下,TDNN模型的F-T(先频域后时域)配置相较基线模型在识别准确率与EER上实现了3%的相对提升。
  • 在基于TDNN的模型中,F-T配置在含噪条件下的原始VoxCeleb1测试集上实现了91.1%的识别准确率与4.91%的EER。
  • 在基于CNN的模型中,F-T配置在相同条件下实现了92.0%的识别准确率与4.81%的EER,展现出强大的鲁棒性。
  • F-T(先频域后时域)配置优于T-F与并行(Para)设置,其中在TDNN的Para设置中γ=0.6、在CNN中γ=0.8时性能最高。
  • 结果表明,频域注意力对识别性能的贡献显著高于时域注意力,尤其在高噪声环境中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。