[论文解读] The DKU-MSXF Speaker Verification System for the VoxCeleb Speaker Recognition Challenge 2023
本论文介绍了DKU-MSXF系统,用于2023年VoxCeleb说话人识别挑战赛,提出了一种跨年龄QMF训练策略,以提升全监督赛道的性能,并提出了一种新颖的伪标签方法,结合三重阈值与子中心净化,用于赛道3的半监督域自适应。该系统在赛道1、赛道2和赛道3分别取得了mDCF 0.1243、0.1165和EER 4.952%的性能表现。
This paper is the system description of the DKU-MSXF System for the track1, track2 and track3 of the VoxCeleb Speaker Recognition Challenge 2023 (VoxSRC-23). For Track 1, we utilize a network structure based on ResNet for training. By constructing a cross-age QMF training set, we achieve a substantial improvement in system performance. For Track 2, we inherite the pre-trained model from Track 1 and conducte mixed training by incorporating the VoxBlink-clean dataset. In comparison to Track 1, the models incorporating VoxBlink-clean data exhibit a performance improvement by more than 10% relatively. For Track3, the semi-supervised domain adaptation task, a novel pseudo-labeling method based on triple thresholds and sub-center purification is adopted to make domain adaptation. The final submission achieves mDCF of 0.1243 in task1, mDCF of 0.1165 in Track 2 and EER of 4.952% in Track 3.
研究动机与目标
- 通过跨年龄数据增强提升全监督设置下的说话人验证性能。
- 通过混合微调方法引入大规模VoxBlink-clean数据集,提升模型泛化能力。
- 通过一种新颖的基于阈值聚类与子中心净化的伪标签策略,解决半监督说话人识别中的域偏移问题。
- 在VoxCeleb说话人识别挑战赛2023年赛道1、赛道2和赛道3中实现最先进性能。
提出的方法
- 采用基于ResNet100的主干网络,结合SimAM与fwSE模块,用于说话人嵌入提取。
- 在赛道1中应用跨年龄QMF训练,以提升不同年龄群体间的泛化能力。
- 在赛道2中,采用混合微调(Mix-FT)方法,结合VoxCeleb2与VoxBlink-clean数据进行训练。
- 提出一个三阶段伪标签处理流程:使用T1构建KNN图,利用T2进行类别纯度估计,通过T3执行类别合并。
- 通过分析子中心ArcFace分类器的选择概率,应用子中心净化方法,以去除低纯度类别。
- 利用QMF和20,000个未标记目标域语音样本组成的群体,对得分进行校准与归一化。
实验结果
研究问题
- RQ1跨年龄QMF训练在全监督设置下如何提升说话人验证性能?
- RQ2通过混合微调方式引入VoxBlink-clean数据集,在多大程度上提升了模型的鲁棒性与准确性?
- RQ3基于阈值的伪标签策略结合子中心净化,能否有效应对半监督说话人识别中的域偏移问题?
- RQ4所提方法与先前方法相比,在VoxSRC-2023挑战赛中,特别是在赛道3的表现如何?
主要发现
- DKU-MSXF系统在赛道1评估集上实现了0.1243的mDCF,显著优于基线系统。
- 在赛道2中,系统实现了0.1165的mDCF,相较于赛道1基线系统相对性能提升超过10%。
- 在赛道3中,系统在官方评估集上实现了4.952%的EER,优于去年第一名结果(EER 7.03%)。
- 在赛道1和赛道2中,通过融合多个模型,验证集上的EER分别降低至2.079%和2.029%。
- 子中心净化步骤有效减少了噪声类别分配,提升了半监督训练中伪标签数据的可靠性。
- 在赛道2中,使用VoxBlink-clean数据的Mix-FT方法相比从零开始训练,实现了超过10%的相对性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。