Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Speaker Recognition with Loss-gated Learning

Ruijie Tao, Kong Aik Lee|arXiv (Cornell University)|Oct 8, 2021
Speech Recognition and Synthesis被引用 7
一句话总结

本文提出损失门控学习(LGL),一种自监督说话人识别方法,通过在训练过程中过滤低损失值样本,动态选择可靠的伪标签。基于神经网络对可靠标签拟合更快的观察,LGL 提升了模型性能,在 VoxCeleb1 上实现了 1.66% 的等错误率(EER),相比无 LGL 的基线模型提升 46.3%。

ABSTRACT

In self-supervised learning for speaker recognition, pseudo labels are useful as the supervision signals. It is a known fact that a speaker recognition model doesn't always benefit from pseudo labels due to their unreliability. In this work, we observe that a speaker recognition network tends to model the data with reliable labels faster than those with unreliable labels. This motivates us to study a loss-gated learning (LGL) strategy, which extracts the reliable labels through the fitting ability of the neural network during training. With the proposed LGL, our speaker recognition model obtains a $46.3\%$ performance gain over the system without it. Further, the proposed self-supervised speaker recognition with LGL trained on the VoxCeleb2 dataset without any labels achieves an equal error rate of $1.66\%$ on the VoxCeleb1 original test set. Code has been made available at: https://github.com/TaoRuijie/Loss-Gated-Learning.

研究动机与目标

  • 为解决自监督说话人识别中不可靠伪标签导致模型性能下降的挑战。
  • 探究神经网络在训练过程中是否对可靠伪标签的拟合速度优于不可靠伪标签。
  • 开发一种动态标签选择策略,通过聚焦于高置信度预测来提升模型泛化能力。
  • 在不使用任何人工标注标签的前提下,实现在 VoxCeleb1 上的最先进性能。

提出的方法

  • LGL 使用基于阈值的过滤机制,选择损失值较低的训练样本,假设其具有可靠的伪标签。
  • 该方法采用随训练迭代动态增加的阈值 τ,逐步在训练过程中纳入更多样本。
  • 在每次迭代中,仅使用过滤后的样本(低损失样本)通过 AAM-softmax 损失更新说话人编码器。
  • 该框架采用两阶段训练流程:对比预训练(阶段 I),随后进行基于 LGL 的迭代伪标签优化(阶段 II)。
  • 说话人编码器使用前一阶段生成的嵌入通过 k-means 聚类方法生成伪标签进行更新。
  • 最终模型采用 1024 通道的说话人编码器,并在 AAM-softmax 损失中设置边距=0.2 和缩放系数=30。

实验结果

研究问题

  • RQ1在自监督训练过程中,神经网络是否对可靠伪标签的拟合速度优于不可靠伪标签?
  • RQ2基于损失的过滤是否能通过选择高置信度伪标签有效提升说话人识别性能?
  • RQ3所提出的 LGL 方法对超参数(如聚类数量和阈值 τ)的选择是否具有鲁棒性?
  • RQ4LGL 对迭代自监督训练中聚类质量与收敛速度有何影响?

主要发现

  • LGL 在 VoxCeleb1 原始测试集上实现了 1.66% 的等错误率(EER),相比现有最佳方法提升 20.95%。
  • 与无 LGL 的基线相比,该方法性能提升 46.3%,显著提高了准确率。
  • LGL 在所有迭代中均持续提升性能,其中在早期阶段(不可靠标签最普遍时)提升最为显著。
  • 该方法对聚类数量(3,000 至 9,000)的变化具有鲁棒性,始终在基线之上保持一致的性能提升。
  • LGL 对阈值超参数 τ 也具有鲁棒性,所有测试值(1–5)均显著优于未过滤基线(τ=∞)。
  • 事后分析表明,LGL 选择的数据集的归一化互信息(NMI)为 0.78,显著高于整体 NMI 值 0.62,证实了对可靠伪标签的有效过滤。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。