Skip to main content
QUICK REVIEW

[论文解读] SJTU-AISPEECH System for VoxCeleb Speaker Recognition Challenge 2022

Zhengyang Chen, Bing Han|arXiv (Cornell University)|Sep 19, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本论文介绍了上海交通大学-AISPEECH系统在2022年VoxCeleb说话人识别挑战赛中的表现,针对第三赛道提出了领域自适应策略,结合自监督与半监督目标,联合训练源域和目标域数据。该系统采用动态损失门控与标签校正(DLG-LC)方法优化伪标签,在第一赛道获得第三名,第三赛道获得第四名,最终融合模型表现优异。

ABSTRACT

This report describes the SJTU-AISPEECH system for the Voxceleb Speaker Recognition Challenge 2022. For track1, we implemented two kinds of systems, the online system and the offline system. Different ResNet-based backbones and loss functions are explored. Our final fusion system achieved 3rd place in track1. For track3, we implemented statistic adaptation and jointly training based domain adaptation. In the jointly training based domain adaptation, we jointly trained the source and target domain dataset with different training objectives to do the domain adaptation. We explored two different training objectives for target domain data, self-supervised learning based angular proto-typical loss and semi-supervised learning based classification loss with estimated pseudo labels. Besides, we used the dynamic loss-gate and label correction (DLG-LC) strategy to improve the quality of pseudo labels when the target domain objective is a classification loss. Our final fusion system achieved 4th place (very close to 3rd place, relatively less than 1%) in track3.

研究动机与目标

  • 为VoxCeleb说话人识别挑战赛2022开发一个鲁棒的说话人验证系统,尤其在领域分布偏移条件下表现优异。
  • 通过在目标域数据上联合使用自监督与半监督训练目标,提升第三赛道中的零样本领域自适应性能。
  • 在弱监督设定下,利用动态损失门控与标签校正(DLG-LC)策略提升伪标签质量。
  • 通过模型融合,在闭集(第一赛道)与开集领域自适应(第三赛道)中均实现最先进性能。
  • 探究不同基于ResNet的主干网络与损失函数在监督学习与领域自适应场景下的表现差异。

提出的方法

  • 为第一赛道实现两个系统:一个在线系统采用实时数据增强,另一个离线系统则通过音速扰动及噪声/混响增强进行大规模预增强。
  • 在线系统采用ResNet与Res2Net主干网络,结合多查询多头注意力池化(MQMHA);离线系统则使用统计池化。
  • 采用多阶段训练:在线系统使用AAM + K-子中心 + 互TopK损失进行预训练,离线系统使用AM + K-子中心;随后通过增大Margin进行大 margin 微调。
  • 针对第三赛道,应用统计领域自适应,并联合训练源域与目标域数据,采用两种目标:角度原型损失(自监督)与基于伪标签的分类损失。
  • 提出动态损失门控与标签校正(DLG-LC)策略,在半监督训练过程中过滤噪声伪标签,提升标签质量。
  • 融合来自不同主干网络与自适应策略的多个模型,生成最终提交结果,采用余弦相似度评分、自适应分数归一化与分数校准技术。

实验结果

研究问题

  • RQ1不同基于ResNet的主干网络与损失函数在闭集说话人验证(第一赛道)中的表现有何影响?
  • RQ2联合训练源域与目标域数据并采用不同目标是否能提升说话人识别中的领域自适应性能?
  • RQ3DLG-LC策略在半监督领域自适应过程中提升伪标签质量的效率如何?
  • RQ4在跨领域联合训练中,使用单个分类头是否比多个分类头生成更具判别性的嵌入表示?
  • RQ5后处理方法如统计自适应、as-norm与分数校准对领域自适应性能的影响如何?

主要发现

  • 离线系统在EER相近的情况下取得更优的minDCF(0.1029),优于在线系统(0.1375),表明数据增强对性能有积极影响。
  • 七套系统融合后在第一赛道验证集上实现EER为1.457%,minDCF为0.1029,获得第三名。
  • OCL策略(单分类头)优于TCL策略(双分类头),在第三赛道上实现8.095% EER与0.3696 minDCF。
  • DLG-LC策略显著提升TCL方法性能,将EER从9.320%降至9.060%,minDCF从0.4254降至0.4180。
  • 最终融合系统在第三赛道验证集上实现7.135% EER与0.3290 minDCF,位列第四(与第三名差距不足1%)。
  • 分数校准将EER降至9.950%,但导致minDCF下降,表明指标间存在权衡;因此最终提交中同时采用as-norm与分数校准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。