[论文解读] UNISOUND System for VoxCeleb Speaker Recognition Challenge 2023
该论文提出UNISOUND系统,在VoxSRC 2023说话人识别挑战赛中,Track 1获得第一名,Track 2获得第二名。该系统引入了一种一致性感知的分数校准方法,利用一致性度量因子(CMF)来衡量音频片段间嵌入的稳定性,结合大规模ResNet和RepVGG主干网络、数据增强以及分数融合,最终实现minDCF为0.0855,EER为1.5880%。
This report describes the UNISOUND submission for Track1 and Track2 of VoxCeleb Speaker Recognition Challenge 2023 (VoxSRC 2023). We submit the same system on Track 1 and Track 2, which is trained with only VoxCeleb2-dev. Large-scale ResNet and RepVGG architectures are developed for the challenge. We propose a consistency-aware score calibration method, which leverages the stability of audio voiceprints in similarity score by a Consistency Measure Factor (CMF). CMF brings a huge performance boost in this challenge. Our final system is a fusion of six models and achieves the first place in Track 1 and second place in Track 2 of VoxSRC 2023. The minDCF of our submission is 0.0855 and the EER is 1.5880%.
研究动机与目标
- 仅使用VoxCeleb2-dev数据,开发一个高性能的说话人识别系统,以应对VoxSRC 2023挑战赛。
- 通过先进的模型架构和数据增强技术,提升系统的鲁棒性和准确性。
- 提出一种新颖的一致性感知分数校准方法,以增强相似性分数的可靠性。
- 在闭集(Track 1)和开集(Track 2)评估协议下,均实现最先进性能。
提出的方法
- 仅使用VoxCeleb2-dev数据,训练大规模ResNet(最多518层)和RepVGG-B1主干网络,采用三倍速数据增强及基于RIR/MUSAN的数据增强。
- 提取80维对数梅尔滤波器组特征,并进行均值归一化,未使用语音活动检测。
- 采用多查询多头注意力(MQMHA)池化,设置4个查询和16个头,ResNet仅使用标准差,RepVGG则同时使用均值和标准差。
- 在两阶段训练中应用AM-Softmax和AAM-Softmax损失函数,配合边缘调度和学习率衰减。
- 提出一致性度量因子(CMF)作为分数校准方法:CMF = (1/N) * ||Σ(x_i / ||x_i||)||,用于衡量时间片段间嵌入的一致性。
- 进一步应用AS-Norm和QMF(质量感知模型融合)对多个模型的分数进行校准与融合。
实验结果
研究问题
- RQ1仅使用VoxCeleb2-dev数据训练的单一系统,是否能在无外部数据的情况下实现VoxSRC 2023挑战赛的顶尖性能?
- RQ2一致性度量因子(CMF)如何通过量化音频片段间嵌入的稳定性来提升说话人识别性能?
- RQ3在池化层中仅使用标准差(而非均值与标准差)对基于ResNet的模型有何影响?
- RQ4CMF、AS-Norm与QMF的组合在闭集和开集评估集上的性能提升效果如何?
- RQ5在数据量极少的情况下,大规模深度网络(如ResNet518和RepVGG-B1)是否能超越小型模型,在说话人验证任务中表现更优?
主要发现
- 最终系统为六个模型(ResNet314、ResNet518和RepVGG-B1)的融合,在VoxSRC2023测试集上实现minDCF为0.0855,EER为1.5880%。
- 基于CMF的校准方法相比基线后处理方法,将minDCF降低了6.6%,显著提升了开发集上的性能。
- 使用CMF配合2秒音频片段的性能优于传统段落评分方法,minDCF从0.1190降低至0.1080。
- 与段落评分相比,CMF方法在短时长音频(2秒)上的EER提升1.3%,minDCF提升1.1%。
- 结合CMF、AS-Norm与QMF的模型融合在VoxSRC2023测试集上实现1.760%的EER和0.0993的minDCF,优于所有基线方法。
- 该系统在VoxSRC 2023中获得Track 1第一名、Track 2第二名,相较于先前工作,在VoxCeleb1-E和VoxCeleb1-H上的minDCF分别相对提升了12.1%和6.8%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。