Skip to main content
QUICK REVIEW

[论文解读] Meta-Learning for Short Utterance Speaker Recognition with Imbalance Length Pairs

Seong Min Kye, Youngmoon Jung|arXiv (Cornell University)|Apr 6, 2020
Speech Recognition and Synthesis参考文献 31被引用 14
一句话总结

该论文提出了一种用于短语音语音识别的元学习框架,采用长短不一的支持-查询对(长注册语音,短测试语音),结合元学习与全局分类,以学习鲁棒且具有判别性的嵌入表征。该方法在VoxCeleb数据集上实现了1–2秒语音验证与未见说话人识别的最先进性能,尽管使用了更简单的模型架构和40维特征,仍优于先前方法。

ABSTRACT

In practical settings, a speaker recognition system needs to identify a speaker given a short utterance, while the enrollment utterance may be relatively long. However, existing speaker recognition models perform poorly with such short utterances. To solve this problem, we introduce a meta-learning framework for imbalance length pairs. Specifically, we use a Prototypical Networks and train it with a support set of long utterances and a query set of short utterances of varying lengths. Further, since optimizing only for the classes in the given episode may be insufficient for learning discriminative embeddings for unseen classes, we additionally enforce the model to classify both the support and the query set against the entire set of classes in the training set. By combining these two learning schemes, our model outperforms existing state-of-the-art speaker verification models learned with a standard supervised learning framework on short utterance (1-2 seconds) on the VoxCeleb datasets. We also validate our proposed model for unseen speaker identification, on which it also achieves significant performance gains over the existing approaches. The codes are available at https://github.com/seongmin-kye/meta-SR.

研究动机与目标

  • 为解决在测试语音较短(1–2秒)时语音识别性能较低的问题,特别是在真实应用场景中。
  • 通过在训练中模拟可变长度短查询的实际条件,提升模型对未见说话人的泛化能力。
  • 通过结合元学习中的支持-查询任务与对全部训练类别的全局分类,提升嵌入的判别性。
  • 在不使用复杂架构或高维特征的前提下,实现在短语音语音验证与未见说话人识别任务上的最先进性能。

提出的方法

  • 采用基于原型网络的元学习框架,每个元学习任务包含一个长语音支持集(5秒)和一个短且可变长度的查询集(1–2秒)。
  • 应用时间平均池化(TAP)进行特征聚合,并采用非边际度量损失进行嵌入学习。
  • 实施双重训练目标:在支持-查询对上优化元学习分类损失,同时在所有样本与全部训练类别之间优化全局分类损失。
  • 使用ResNet34作为主干网络,并采用40维对数梅尔滤波器组特征,以降低计算成本并保持高效性。
  • 在训练中使模型能够将短语音匹配到其对应的长注册样本,同时确保嵌入在所有说话人类别间具有判别性。
  • 通过在训练中引入未见说话人,强化训练与推理之间的一致性,从而提升零样本泛化能力。

实验结果

研究问题

  • RQ1与标准监督训练相比,使用不平衡长度的支持-查询对进行元学习,能否提升短语音语音验证的性能?
  • RQ2将元学习中的支持-查询任务与对全部训练类别的全局分类相结合,是否能增强嵌入的判别性与对语音时长变化的鲁棒性?
  • RQ3所提出方法在仅有限注册数据下,对未见说话人识别任务的泛化能力如何?
  • RQ4在元训练过程中,查询语音的长度与可变性在多大程度上影响模型性能?
  • RQ5在短语音设置下,是否能通过更简单的模型架构与低维特征,超越更复杂的最先进模型?

主要发现

  • 所提模型在VoxCeleb1数据集的1–2秒语音验证任务中达到最先进性能,优于先前方法,包括采用复杂聚合方式与边际损失的方法。
  • 在未见说话人识别任务中,1秒查询的准确率达到96.40%,2秒查询达到98.38%(5分类任务),显著优于基线方法。
  • 采用不平衡长度对(可变短查询)的模型优于等长与固定长度配对设置,证明其对时长变化具有更强鲁棒性。
  • 即使使用40维特征且无高级聚合或边际优化,其性能仍优于使用更高维输入与复杂模块的基线模型。
  • 随着候选说话人数目的增加,所提方法与基线训练方法之间的性能差距扩大,表明其在开放集场景下具备强大泛化能力。
  • 全局分类损失显著改善了类间聚类效果,并减少了由语音时长效应引起方差,从而生成更具判别性的嵌入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。