Skip to main content
QUICK REVIEW

[论文解读] The Phonexia VoxCeleb Speaker Recognition Challenge 2021 System Description

J. Slavicek, Albert Swart|arXiv (Cornell University)|Sep 5, 2021
Speech Recognition and Synthesis参考文献 15被引用 6
一句话总结

本论文介绍了Phonexia在VoxCeleb 2021挑战赛中提出的自监督说话人识别系统,该系统利用带有伪标签的迭代聚类与对比学习训练深度神经网络嵌入表示。通过融合五个经zt归一化的余弦相似度得分(来自多个嵌入提取器),系统在测试集上达到4.986%的EER,排名第二。

ABSTRACT

We describe the Phonexia submission for the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC-21) in the unsupervised speaker verification track. Our solution was very similar to IDLab's winning submission for VoxSRC-20. An embedding extractor was bootstrapped using momentum contrastive learning, with input augmentations as the only source of supervision. This was followed by several iterations of clustering to assign pseudo-speaker labels that were then used for supervised embedding extractor training. Finally, a score fusion was done, by averaging the zt-normalized cosine scores of five different embedding extractors. We briefly also describe unsuccessful solutions involving i-vectors instead of DNN embeddings and PLDA instead of cosine scoring.

研究动机与目标

  • 开发一种自监督说话人识别系统,在训练阶段无需访问说话人标签的情况下仍能保持竞争力。
  • 探究使用迭代聚类生成伪说话人标签在提升自监督学习中嵌入质量方面的有效性。
  • 评估得分归一化与模型融合对最终系统性能的影响。
  • 探索PLDA与i-向量等替代评分后端的可行性,并确定其在自监督设置下的局限性。
  • 评估从零开始训练(tabula rasa)的可行性,并提出一种基于域外有标签数据的适应性替代方案。

提出的方法

  • 训练从仅使用输入增强作为监督信号的动量对比学习开始,生成对比损失所需的正样本对与负样本对。
  • 应用迭代聚类:使用k-means与凝聚层次聚类(AHC)将前一模型的嵌入聚类为7,500个伪说话人,作为监督训练的伪标签。
  • 并行训练两个神经网络,交替使用对方的伪标签进行更新,受自蒸馏技术启发。
  • 在迭代过程中调整训练设置,如学习率调整、使用边缘为m=0.3的AAM-Softmax损失,以及采用6秒的训练样本,以提升收敛性与性能。
  • 最终得分通过平均五个不同嵌入提取器的zt归一化余弦相似度获得,归一化使用训练数据中的随机样本组。
  • 在最后一次迭代中应用BiTempered损失,参数设置为t1=0.99与t2=1.01,以提升泛化能力。

实验结果

研究问题

  • RQ1与端到端对比预训练相比,使用聚类生成的迭代伪标签是否能显著提升自监督说话人嵌入的质量?
  • RQ2使用随机样本组进行得分归一化是否能提升自监督说话人验证中余弦得分的鲁棒性与准确性?
  • RQ3为何尽管使用了自监督嵌入,i-向量与PLDA基线模型仍未能提升性能,其在该设置下的局限性是什么?
  • RQ4在自监督说话人识别中,多个独立训练的提取器进行模型融合能在多大程度上提升最终系统性能?
  • RQ5从零开始的自监督训练是否真正可行且有效?在实际应用中,是否应优先采用基于大规模有标签数据的微调策略?

主要发现

  • 在VoxSRC-21验证集上,融合五个不同模型的zt归一化余弦得分后,最终系统达到4.986%的EER。
  • 最佳单模型(iter15bt)在融合前的EER为5.319%,经zt归一化后降至4.885%。
  • 通过zt归一化与得分融合,EER相比最佳单模型降低了0.38%,证明了集成评分的有效性。
  • 迭代聚类过程在第10轮后收益递减,第8轮后性能提升显著放缓。
  • 尽管进行了大量实验,i-向量与PLDA后端均未能超越简单余弦得分,其中i-向量的EER超过20%。
  • 最终系统在竞赛中排名第二,仅次于一支后来被撤回的团队,位列VoxSRC-2021顶级自监督系统之列。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。