Skip to main content
QUICK REVIEW

[论文解读] The DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022

Xiaoyi Qin, Na Li|arXiv (Cornell University)|Oct 11, 2022
Speech Recognition and Synthesis被引用 6
一句话总结

本论文介绍了DKU-Tencent在VoxCeleb说话人识别挑战赛2022中的系统,提出了一种混合方法:在track1(跨年龄验证)中结合数据增强、多骨干网络模型与质量感知得分校准;在track3中通过伪标签的半监督域自适应方法,结合子中心ArcFace实现。该系统在track1中取得0.107 mDCF的成绩,在track3中取得7.135% EER的成绩,通过基于QMF的校准和稳健的训练协议显著提升了性能。

ABSTRACT

This paper is the system description of the DKU-Tencent System for the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC22). In this challenge, we focus on track1 and track3. For track1, multiple backbone networks are adopted to extract frame-level features. Since track1 focus on the cross-age scenarios, we adopt the cross-age trials and perform QMF to calibrate score. The magnitude-based quality measures achieve a large improvement. For track3, the semi-supervised domain adaptation task, the pseudo label method is adopted to make domain adaptation. Considering the noise labels in clustering, the ArcFace is replaced by Sub-center ArcFace. The final submission achieves 0.107 mDCF in task1 and 7.135% EER in task3.

研究动机与目标

  • 为解决track1中的跨年龄说话人识别挑战,提升不同年龄群体间的泛化能力。
  • 利用未标注的目标域数据,实现有效的半监督域自适应。
  • 降低聚类-based域自适应中噪声伪标签的影响。
  • 通过质量度量函数(QMF)和得分归一化提升系统鲁棒性。
  • 在VoxCeleb2022基准上,为完全监督和半监督任务均实现最先进性能。

提出的方法

  • 系统采用实时数据增强方法,结合MUSAN和RIR噪声,以及速度扰动和音量变化,以提升训练多样性。
  • 使用多个骨干网络——SimAM-ResNet34、ResNet101、ResNet152、Res2Net101——提取帧级特征,随后通过统计池化、标准差池化或注意力统计池化生成段级嵌入。
  • 第一阶段训练使用ArcFace损失,边缘参数为0.2,缩放参数为32;随后进行大边缘微调(LMFT),将边缘参数增至0.5,并减少数据增强。
  • 采用自适应对称得分归一化(AS-Norm)以及基于语音时长和嵌入幅值的质量度量函数(QMF)进行得分校准。
  • 对于track3,通过K-means聚类在未标注的目标域数据上生成伪标签,K值为1600–2000,由肘部法则确定,同时使用子中心ArcFace以缓解噪声标签的影响。
  • 最终系统采用八种不同架构的模型融合,对长语音进行截断至20秒,并使用20,000个目标域样本进行基于同群的归一化。

实验结果

研究问题

  • RQ1数据增强与模型架构多样性在多大程度上能提升跨年龄说话人验证的性能?
  • RQ2基于时长和幅值的质量度量函数(QMF)在多大程度上能改善跨年龄场景下的得分校准?
  • RQ3通过聚类生成的伪标签是否能有效实现说话人识别中的半监督域自适应?
  • RQ4将ArcFace替换为子中心ArcFace是否能降低在聚类-based自适应中对噪声伪标签的敏感性?
  • RQ5在跨域说话人验证中,平衡泛化能力与鲁棒性的最优训练协议是什么?

主要发现

  • 基线模型SimAM-ResNet34在Vox-O上取得0.542% EER和0.034 mDCF,但在评估集上性能显著下降,凸显了域偏移问题。
  • 应用基于QMF的得分校准后,Vox-CA测试集上的mDCF从0.263降至0.139,相对提升达30%。
  • 最终融合系统在track1评估中实现0.107 mDCF,证明了多模型集成与QMF校准的有效性。
  • 在track3中,使用子中心ArcFace结合伪标签后,AS-Norm与QMF校准后EER从8.680%降至8.090%,表现出对噪声标签的强鲁棒性。
  • 最终系统在track3评估集上取得7.135% EER,提交结果中EER稳定为7.153%,表明具有出色的泛化能力。
  • 第二轮微调导致性能下降,因此在track3中所有模型仅采用一轮聚类与微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。