Skip to main content
QUICK REVIEW

[论文解读] The HCCL system for VoxCeleb Speaker Recognition Challenge 2022

Zhenduo Zhao, Zhuo Li|arXiv (Cornell University)|May 22, 2023
Speech Recognition and Synthesis被引用 6
一句话总结

本论文介绍了HCCL系统在VoxCeleb说话人识别挑战赛2022中的应用,提出了一种新颖的渐进式子图聚类方法,结合双高斯拟合与多模型投票,用于在低资源设置下生成伪标签。该系统在Track 1中取得最先进性能,minDCF为0.1397,EER为2.414;在Track 3中通过领域自适应、标签修正与集成建模策略获得第一名,EER为7.030,minDCF为0.388。

ABSTRACT

This report describes our submission to track1 and track3 for VoxCeleb Speaker Recognition Challenge 2022(VoxSRC2022). Our best system achieves minDCF 0.1397 and EER 2.414 in track1, minDCF 0.388 and EER 7.030 in track3.

研究动机与目标

  • 通过开发有效的领域自适应与伪标签生成策略,解决Track 3中仅提供50个标注说话人时的低资源说话人识别问题。
  • 通过先进的数据增强与训练协议,提升模型在真实场景下的泛化能力与鲁棒性。
  • 开发一种渐进式子图聚类算法,结合双高斯拟合与多模型投票,从无标签数据中生成高质量伪标签。
  • 利用基于置信度的多模型投票策略纠正噪声伪标签,提升聚类纯度与最终识别准确率。
  • 通过集成建模与评分校准技术,在VoxSRC2022多个赛道中实现最先进性能。

提出的方法

  • 提出一种渐进式子图聚类算法(GMVPG),利用双高斯拟合检测并基于说话人内话语相似度得分合并子簇。
  • 整合多模型预测以投票判断标签一致性,仅保留多模型预测一致的样本用于标签修正。
  • 采用置信度阈值划分策略:高置信度(sim_top1 > 0.5,sim_top2 < 0.4)、中置信度(两者均 > 0.4)与低置信度(sim_top1 < 0.5),以指导标签修正。
  • 实现一个函数CheckCombine,根据高斯参数(μ, σ, w)与阈值th_nm判断两个簇是否应合并。
  • 实施两阶段训练协议:第一阶段采用循环学习率与数据增强,第二阶段通过增加权重衰减进行大 margin 微调。
  • 应用自适应评分归一化(AS-norm)与质量度量函数(QMF),结合逻辑回归,利用同群集与试验集对评分进行校准。

实验结果

研究问题

  • RQ1当仅提供50个标注说话人时,如何在低资源说话人识别中可靠地生成伪标签?
  • RQ2结合双高斯拟合的渐进式子图聚类方法在多大程度上能提升聚类纯度与说话人识别性能?
  • RQ3多模型投票与基于置信度的过滤在纠正聚类算法生成的噪声伪标签方面效果如何?
  • RQ4领域自适应与数据增强对真实场景下说话人识别模型泛化能力的影响如何?
  • RQ5集成建模与评分校准是否能显著提升VoxSRC2022中Track 1与Track 3的minDCF与EER?

主要发现

  • HCCL系统在Track 1中实现minDCF 0.1397与EER 2.414,位列100多支参赛队伍中的第6名。
  • 在Track 3中,系统实现EER 7.030与minDCF 0.388,以100多支队伍中的第一名成绩胜出。
  • S1–S5多个模型融合并结合标签修正后,Track 3开发集EER从8.78%降至6.77%,测试集EER从8.42%降至7.03%。
  • 所提出的GMVPG聚类算法在标签修正后,将说话人数量从1711人提升至1760人,语句数从348,861条增至387,700条。
  • 采用LMF(大 margin 微调)的两阶段训练协议使多个模型的EER降低0.15–0.25%。
  • 应用自适应评分归一化与QMF校准使Track 1的EER降低最多达0.5%,并显著提升了最终排名。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。