Skip to main content
QUICK REVIEW

[论文解读] The Kriston AI System for the VoxCeleb Speaker Recognition Challenge 2022

Qutang Cai, Guoqiang Hong|arXiv (Cornell University)|Sep 23, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

本论文介绍了Kriston AI团队在VoxCeleb说话人识别挑战赛2022中的系统实现,通过结合改进的ResNet架构与加权模型融合,在全部三个赛道中均获得第二名,说话人验证性能达到minDCF 0.072,EER 1.119%;同时在语音活动检测(VAD)、说话人嵌入提取、层次聚类、贝叶斯HMM重聚类以及重叠语音检测方面进行了集成,实现端到端语音分割,最终获得DER 4.86%。

ABSTRACT

This technical report describes our system for track 1, 2 and 4 of the VoxCeleb Speaker Recognition Challenge 2022 (VoxSRC-22). By combining several ResNet variants, our submission for track 1 attained a minDCF of 0:090 with EER 1:401%. By further incorporating three fine-tuned pre-trained models, our submission for track 2 achieved a minDCF of 0:072 with EER 1:119%. For track 4, our system consisted of voice activity detection (VAD), speaker embedding extraction, agglomerative hierarchical clustering (AHC) followed by a re-clustering step based on a Bayesian hidden Markov model and overlapped speech detection and handling. Our submission for track 4 achieved a diarisation error rate (DER) of 4.86%. The submissions all ranked the 2nd places for the corresponding tracks.

研究动机与目标

  • 为VoxSRC-22挑战赛开发一个基于多样化深度学习架构的鲁棒说话人识别与分割系统。
  • 通过融合多种改进的ResNet变体并采用加权融合策略,提升说话人验证任务的性能。
  • 通过集成语音活动检测(VAD)、说话人嵌入聚类及重叠语音处理技术,提升分割任务的准确性。
  • 利用预训练模型与数据增强技术,提升在开放集挑战(赛道2与赛道4)下的性能表现。
  • 在VoxSRC-22基准数据集上实现最先进水平的性能表现,且验证集与测试集结果偏差极小。

提出的方法

  • 在VoxCeleb2开发集上训练六种改进的ResNet变体,通过调整输入维度、深度、卷积核大小、注意力机制及替代下采样策略,以增强模型多样性。
  • 提出一种打乱多头注意力(SMHA)池化方法,以提升说话人嵌入建模中不同注意力头之间的交互能力。
  • 采用加权线性组合方式融合各独立模型,其中ResNet模型权重设为1,赛道2中预训练模型权重设为1,1,2。
  • 使用基于同群的AS-Norm进行得分归一化,选取前300名伪说话人得分,并在VoxCeleb1-H上进行逻辑回归校准。
  • 构建一个端到端的分割流水线,集成VAD(融合FBank、MFCC与pyannote模型)、1.5秒滑动窗口说话人嵌入提取、AHC聚类及改进方程的VB-HMM重聚类(用于后验概率估计)。
  • 通过类似VAD的模型实现重叠语音检测,并通过后处理识别并解决说话人重叠问题,方法为寻找最接近的说话人对。

实验结果

研究问题

  • RQ1在封闭集挑战中,融合多种多样化ResNet变体的模型集成策略在提升说话人验证性能方面效果如何?
  • RQ2与从零开始训练相比,微调后的预训练模型在开放集说话人验证(赛道2)中的性能提升程度如何?
  • RQ3结合VAD、聚类与贝叶斯HMM重聚类的混合分割系统,能否有效降低真实世界中噪声与重叠语音场景下的分割错误率(DER)?
  • RQ4在真实场景中,集成重叠语音检测与处理机制如何提升说话人分割的鲁棒性?
  • RQ5在说话人验证任务中,得分归一化与校准对最终系统性能的影响如何?

主要发现

  • 在赛道1中,融合系统在仅使用VoxCeleb2开发集数据的情况下,实现了minDCF 0.090与EER 1.401%的优异表现,证明了其在封闭集挑战中的强大性能。
  • 通过引入三个微调后的预训练模型,系统在赛道2中实现minDCF 0.072与EER 1.119%,排名第二,且在开放集数据上展现出更强的泛化能力。
  • 分割系统在评估集上实现DER 4.86%与JER 25.48%,最佳配置(VB+asnorm)相比基线VB将DER降低0.13%,验证了方法的有效性。
  • VAD融合系统在赛道4-dev2上实现95.37%的准确率,误报率(FA)为3.55%,漏检率(MISS)为1.06%,表现出稳健的语音活动检测能力。
  • 通过采用改进的VB-HMM方程(2)与(3)进行重聚类,相比标准VB-HMM,DER降低0.13%,验证了所提出后验建模方法的有效性。
  • 系统在验证集与测试集之间保持了高度一致的性能表现,结果偏差极小,表明其具备出色的泛化能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。