Skip to main content
QUICK REVIEW

[论文解读] Beijing ZKJ-NPU Speaker Verification System for VoxCeleb Speaker Recognition Challenge 2021

Li Zhang, Huan Zhao|arXiv (Cornell University)|Sep 8, 2021
Speech Recognition and Synthesis参考文献 31被引用 5
一句话总结

本论文介绍了北京ZKJ-NPU系统在VoxCeleb说话人识别挑战赛2021中的表现,该系统在完全监督的两个赛道(赛道1和赛道2)中均获得第二名。该系统采用多种深度神经网络模型,包括E-TDNN、ECAPA-TDNN、ResNet变体、CoAtNet和PyConv,并结合先进的训练策略,如大 margin 微调、嵌入归一化、分数归一化以及模型融合,分别在赛道1和赛道2的测试集上实现了0.1205和0.1175的minDCF,以及2.816%和2.840%的EER。

ABSTRACT

In this report, we describe the Beijing ZKJ-NPU team submission to the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC-21). We participated in the fully supervised speaker verification track 1 and track 2. In the challenge, we explored various kinds of advanced neural network structures with different pooling layers and objective loss functions. In addition, we introduced the ResNet-DTCF, CoAtNet and PyConv networks to advance the performance of CNN-based speaker embedding model. Moreover, we applied embedding normalization and score normalization at the evaluation stage. By fusing 11 and 14 systems, our final best performances (minDCF/EER) on the evaluation trails are 0.1205/2.8160% and 0.1175/2.8400% respectively for track 1 and 2. With our submission, we came to the second place in the challenge for both tracks.

研究动机与目标

  • 为VoxCeleb说话人识别挑战赛2021开发高性能的完全监督训练说话人验证系统。
  • 探索先进的深度神经网络架构(包括ResNet-DTCF、CoAtNet和PyConv),以提升说话人嵌入学习效果。
  • 通过训练阶段和评估阶段的技术手段(如大 margin 微调、嵌入归一化和分数归一化)进一步提升性能。
  • 通过在赛道1和赛道2上融合多个多样化系统,实现最先进水平的性能表现。

提出的方法

  • 基于TDNN和ResNet架构训练了15种多样化的说话人嵌入模型,包括E-TDNN、ECAPA-TDNN、ResNet-SE、ResNet-BAM、SE-Res2Net和CoAtNet。
  • 应用在线数据增强技术,包括频域SpecAug、加性噪声(MUSAN)、混响(RIR-based)以及通过速度扰动实现的说话人增强。
  • 以梅尔频率倒谱系数(MFCCs)和梅尔滤波器组(Fbank)特征作为输入,使用交叉熵、AAM-softmax、SC-AAM-softmax或Circle Loss进行模型训练。
  • 在训练过程中引入大 margin 微调(LMF),以改善类间分离度和边际学习能力。
  • 在推理阶段应用嵌入归一化和分数归一化(矩阵分数平均),以降低分数方差并提升泛化性能。
  • 使用BOSARIS工具包对11个和14个系统进行线性融合,显著优于单一模型的性能表现。

实验结果

研究问题

  • RQ1混合CNN架构(如ResNet-DTCF和CoAtNet)在说话人验证任务中与标准TDNN和ResNet模型相比表现如何?
  • RQ2归一化技术(嵌入归一化和分数归一化)对说话人验证系统泛化能力和性能的影响如何?
  • RQ3大 margin 微调是否能在完全监督设置下提升说话人嵌入模型的判别能力?
  • RQ4模型融合在结合多样化架构以实现VoxSRC-2021基准测试卓越性能方面有多有效?
  • RQ5如SpecAug、噪声和混响等数据增强策略在多语言说话人验证中对鲁棒性提升的贡献程度如何?

主要发现

  • 14个系统的融合在赛道2上实现了0.1175的minDCF和2.840%的EER,获得第二名。
  • 11个系统的融合在赛道1上实现了0.1205的minDCF和2.816%的EER,同样位列第二。
  • 在评估阶段应用嵌入归一化和分数归一化,相比基线模型带来了明显的性能提升。
  • 混合模型(如CNN-ECAPA和ResNet-Pyramid)优于独立的ResNet和TDNN变体。
  • 大 margin 微调显著提升了模型泛化能力,使多个模型的minDCF降低了高达0.03。
  • 基于CoAtNet的模型虽然单独性能略低,但在融合集成中表现出有效互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。