Skip to main content
QUICK REVIEW

[论文解读] UNISOUND System for VoxCeleb Speaker Recognition Challenge 2023

Yufeng Zheng, Yajun Zhang|arXiv (Cornell University)|Aug 24, 2023
Speech Recognition and Synthesis被引用 4
一句话总结

该论文提出UNISOUND系统,在VoxSRC 2023说话人识别挑战赛中,Track 1获得第一名,Track 2获得第二名。该系统引入了一种一致性感知的分数校准方法,利用一致性度量因子(CMF)来衡量音频片段间嵌入的稳定性,结合大规模ResNet和RepVGG主干网络、数据增强以及分数融合,最终实现minDCF为0.0855,EER为1.5880%。

ABSTRACT

This report describes the UNISOUND submission for Track1 and Track2 of VoxCeleb Speaker Recognition Challenge 2023 (VoxSRC 2023). We submit the same system on Track 1 and Track 2, which is trained with only VoxCeleb2-dev. Large-scale ResNet and RepVGG architectures are developed for the challenge. We propose a consistency-aware score calibration method, which leverages the stability of audio voiceprints in similarity score by a Consistency Measure Factor (CMF). CMF brings a huge performance boost in this challenge. Our final system is a fusion of six models and achieves the first place in Track 1 and second place in Track 2 of VoxSRC 2023. The minDCF of our submission is 0.0855 and the EER is 1.5880%.

研究动机与目标

  • 仅使用VoxCeleb2-dev数据,开发一个高性能的说话人识别系统,以应对VoxSRC 2023挑战赛。
  • 通过先进的模型架构和数据增强技术,提升系统的鲁棒性和准确性。
  • 提出一种新颖的一致性感知分数校准方法,以增强相似性分数的可靠性。
  • 在闭集(Track 1)和开集(Track 2)评估协议下,均实现最先进性能。

提出的方法

  • 仅使用VoxCeleb2-dev数据,训练大规模ResNet(最多518层)和RepVGG-B1主干网络,采用三倍速数据增强及基于RIR/MUSAN的数据增强。
  • 提取80维对数梅尔滤波器组特征,并进行均值归一化,未使用语音活动检测。
  • 采用多查询多头注意力(MQMHA)池化,设置4个查询和16个头,ResNet仅使用标准差,RepVGG则同时使用均值和标准差。
  • 在两阶段训练中应用AM-Softmax和AAM-Softmax损失函数,配合边缘调度和学习率衰减。
  • 提出一致性度量因子(CMF)作为分数校准方法:CMF = (1/N) * ||Σ(x_i / ||x_i||)||,用于衡量时间片段间嵌入的一致性。
  • 进一步应用AS-Norm和QMF(质量感知模型融合)对多个模型的分数进行校准与融合。

实验结果

研究问题

  • RQ1仅使用VoxCeleb2-dev数据训练的单一系统,是否能在无外部数据的情况下实现VoxSRC 2023挑战赛的顶尖性能?
  • RQ2一致性度量因子(CMF)如何通过量化音频片段间嵌入的稳定性来提升说话人识别性能?
  • RQ3在池化层中仅使用标准差(而非均值与标准差)对基于ResNet的模型有何影响?
  • RQ4CMF、AS-Norm与QMF的组合在闭集和开集评估集上的性能提升效果如何?
  • RQ5在数据量极少的情况下,大规模深度网络(如ResNet518和RepVGG-B1)是否能超越小型模型,在说话人验证任务中表现更优?

主要发现

  • 最终系统为六个模型(ResNet314、ResNet518和RepVGG-B1)的融合,在VoxSRC2023测试集上实现minDCF为0.0855,EER为1.5880%。
  • 基于CMF的校准方法相比基线后处理方法,将minDCF降低了6.6%,显著提升了开发集上的性能。
  • 使用CMF配合2秒音频片段的性能优于传统段落评分方法,minDCF从0.1190降低至0.1080。
  • 与段落评分相比,CMF方法在短时长音频(2秒)上的EER提升1.3%,minDCF提升1.1%。
  • 结合CMF、AS-Norm与QMF的模型融合在VoxSRC2023测试集上实现1.760%的EER和0.0993的minDCF,优于所有基线方法。
  • 该系统在VoxSRC 2023中获得Track 1第一名、Track 2第二名,相较于先前工作,在VoxCeleb1-E和VoxCeleb1-H上的minDCF分别相对提升了12.1%和6.8%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。