Skip to main content
QUICK REVIEW

[论文解读] Large-scale learning of generalised representations for speaker recognition

Jee-weon Jung, Hee-Soo Heo|arXiv (Cornell University)|Oct 20, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本论文提出了一种大规模、通用的端到端说话人识别模型,该模型从零开始训练,使用多样化的海量数据集和先进架构。采用包含超过87,000名说话人和10,220小时语音的MFA-Conformer模型,在四个评估协议中平均性能提升超过20%,展现出显著优于基于CNN的基线模型(如ECAPA-TDNN)的泛化能力。

ABSTRACT

The objective of this work is to develop a speaker recognition model to be used in diverse scenarios. We hypothesise that two components should be adequately configured to build such a model. First, adequate architecture would be required. We explore several recent state-of-the-art models, including ECAPA-TDNN and MFA-Conformer, as well as other baselines. Second, a massive amount of data would be required. We investigate several new training data configurations combining a few existing datasets. The most extensive configuration includes over 87k speakers' 10.22k hours of speech. Four evaluation protocols are adopted to measure how the trained model performs in diverse scenarios. Through experiments, we find that MFA-Conformer with the least inductive bias generalises the best. We also show that training with proposed large data configurations gives better performance. A boost in generalisation is observed, where the average performance on four evaluation protocols improves by more than 20%. In addition, we also demonstrate that these models' performances can improve even further when increasing capacity.

研究动机与目标

  • 开发一个单一的、通用的说话人识别模型,适用于电话通信、说话人分割和开放集识别等多种真实世界场景。
  • 探究在不使用自监督学习预训练的情况下,从零开始训练大规模说话人嵌入模型是否能够实现最先进的泛化性能。
  • 评估模型架构(如CNN与基于Transformer的架构)以及训练数据规模对多个评估协议中泛化性能的影响。
  • 确定在结合大规模数据的前提下,增加模型容量(深度、宽度、嵌入维度)是否能进一步提升性能。
  • 通过在多个数据集上统一的训练与评估框架,建立可泛化的说话人表征学习基准。

提出的方法

  • 使用多个公开数据集(VoxCeleb1/2、NIST SRE、CommonVoice和MLS)的组合,从零开始训练说话人嵌入模型,总计超过87,000名说话人和10,220小时语音。
  • 评估四种不同的模型架构:ECAPA-TDNN、Res2NetSE50、RawNet3和MFA-Conformer,其中MFA-Conformer表现最佳。
  • 在拼接的编码器输出上应用注意力统计池化,以生成话语级别的嵌入,从而提升MFA-Conformer模型的表征质量。
  • 系统性地改变训练数据配置(v0至v4),以评估数据规模和领域多样性对模型泛化能力的影响。
  • 通过增加模型深度、宽度和嵌入维度进行消融研究,评估模型容量对多个评估协议性能的影响。
  • 应用四种评估协议:Vox1-O(开放集识别)、DIHARD3(说话人分割)、VoxConverse(对话语音)和NIST SRE 2010(电话语音),以衡量跨场景泛化能力。

实验结果

研究问题

  • RQ1使用大规模、多样化数据集从零开始训练说话人识别模型,是否相比自监督学习预训练模型或小规模训练,能在多种真实世界场景中实现更好的泛化?
  • RQ2在相同大规模数据上训练时,不同神经网络架构(尤其是基于CNN的ECAPA-TDNN与基于自注意力机制的MFA-Conformer)在泛化性能上的表现差异如何?
  • RQ3在同时覆盖多种评估协议的情况下,增加训练数据量和模型容量(参数量)能在多大程度上提升性能?
  • RQ4一个统一的单一模型是否能在无需任务特定微调的情况下,实现对电话通信、对话语音和开放集识别等不同领域均表现强劲?
  • RQ5结合具有不同领域特征的数据集(如VoxCeleb、CommonVoice、NIST SRE)是否比使用单一数据集带来更好的泛化效果?

主要发现

  • 基于自注意力机制、归纳偏差极小的MFA-Conformer架构,在所有四个评估协议中均显著优于以CNN为主的ECAPA-TDNN,展现出更强的泛化能力。
  • 使用最大规模数据配置(v4,88,000名说话人,10.22千小时)相比基线v0配置,在所有评估协议中平均性能提升超过20%。
  • 增加模型容量——特别是拓宽网络结构并增加嵌入维度——进一步提升了性能,最佳结果(平均EER为3.82%)在v4配置下结合宽度与嵌入维度扩展后取得。
  • 模型在Vox1-O上达到0.68%的EER,在DIHARD3上达到2.45%的EER,在VoxConverse上达到3.85%的EER,在NIST SRE 2010上达到8.33%的EER,展现出强大的跨领域鲁棒性。
  • 在扩展数据规模和模型容量时,性能提升在所有协议中均保持一致,DIHARD3上的绝对性能仅下降0.03%,表明对任一任务的负面影响极小。
  • 结合多样化数据集(包括CommonVoice和MLS)有助于提升泛化能力,但单纯增加CommonVoice数据量(v2配置)并未带来一致性能增益,凸显了数据质量与领域平衡的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。