Skip to main content
QUICK REVIEW

[论文解读] Centroid-based deep metric learning for speaker recognition

Jixuan Wang, Kuan-Chieh Wang|arXiv (Cornell University)|Feb 6, 2019
Speech Recognition and Synthesis参考文献 24被引用 10
一句话总结

本文提出一种基于质心的深度度量学习方法,采用原型网络损失(PNL)用于说话人识别,取代端到端说话人嵌入模型中的传统三元组损失。基于PNL的模型在说话人验证和识别任务中,对已见和未见说话人均取得了最先进性能,显著优于三元组损失模型,且训练速度更快、更稳定,对超参数不敏感。

ABSTRACT

Speaker embedding models that utilize neural networks to map utterances to a space where distances reflect similarity between speakers have driven recent progress in the speaker recognition task. However, there is still a significant performance gap between recognizing speakers in the training set and unseen speakers. The latter case corresponds to the few-shot learning task, where a trained model is evaluated on unseen classes. Here, we optimize a speaker embedding model with prototypical network loss (PNL), a state-of-the-art approach for the few-shot image classification task. The resulting embedding model outperforms the state-of-the-art triplet loss based models in both speaker verification and identification tasks, for both seen and unseen speakers.

研究动机与目标

  • 解决低资源设置下已见与未见说话人识别之间的性能差距。
  • 通过利用原型网络损失(PNL)提升少样本说话人识别中的泛化能力。
  • 在端到端说话人嵌入模型中,对比PNL与三元组损失(TL)在验证和识别任务中的表现。
  • 评估PNL的实际优势,如减少超参数敏感性与更快的训练速度。
  • 证明基于PNL的模型在有限注册数据条件下对未见说话人具有更好的泛化能力。

提出的方法

  • 模型使用循环神经网络将语音序列嵌入到高维空间,其中说话人相似性通过距离度量。
  • 原型网络损失(PNL)在训练过程中,为每个说话人计算支持样本的平均嵌入作为类别原型。
  • PNL最小化每个支持样本与其类别原型之间的距离,同时最大化与其他原型的距离。
  • 损失函数被表述为嵌入与各自原型之间Bregman散度的总和,使用余弦或欧氏距离。
  • 模型端到端使用PNL进行训练,无需三元组采样或边缘超参数α。
  • 推理时,从注册语音中计算说话人原型,并通过与阈值的距离比较完成验证。

实验结果

研究问题

  • RQ1原型网络损失(PNL)是否能在已见和未见说话人上均优于三元组损失(TL)的说话人嵌入学习?
  • RQ2为何在少样本说话人识别场景中,PNL比TL具有更好的泛化能力?
  • RQ3在训练稳定性、速度和超参数敏感性方面,PNL与TL相比如何?
  • RQ4将类别原型作为质心是否能提升短语音和低样本设置下的嵌入质量?
  • RQ5尽管PNL最初设计用于图像少样本学习,它能否有效应用于序列语音数据?

主要发现

  • 在VoxCeleb2上,PNL模型在未见说话人上的SI准确率达到66.63%,而使用余弦距离的三元组损失模型为59.61%。
  • 在VCTK上,PNL模型在10秒注册数据下的EER为10.77%,而三元组损失模型为13.87%。
  • 与最佳三元组损失变体相比,PNL在VCTK上将EER降低了2.16个百分点,在VoxCeleb2上降低了1.24个百分点。
  • 由于每批次减少成对计算,PNL训练速度约为三元组损失训练的3倍。
  • PNL在不同样本数(3–10)下表现出鲁棒性,各类少样本设置下性能保持一致。
  • 统计分析证实,PNL在未见说话人场景下显著优于TL(p ≪ 0.001)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。