Skip to main content
QUICK REVIEW

[论文解读] Disentangling Voice and Content with Self-Supervision for Speaker Recognition

Tianchi Liu, Kong Aik Lee|arXiv (Cornell University)|Oct 2, 2023
Speech Recognition and Synthesis被引用 5
一句话总结

本文提出 RecXi,一种自监督解缠框架,通过引入三个高斯推理层与强化的转移模型,将说话人特征与语音内容分离。仅利用说话人身份标签,不依赖文本标注或额外模型,RecXi 在 VoxCeleb 和 SITW 数据集上分别实现了 9.56% 和 8.24% 的平均 EER 与 minDCF 降低,展示了无需额外数据或训练的优越说话人识别性能。

ABSTRACT

For speaker recognition, it is difficult to extract an accurate speaker representation from speech because of its mixture of speaker traits and content. This paper proposes a disentanglement framework that simultaneously models speaker traits and content variability in speech. It is realized with the use of three Gaussian inference layers, each consisting of a learnable transition model that extracts distinct speech components. Notably, a strengthened transition model is specifically designed to model complex speech dynamics. We also propose a self-supervision method to dynamically disentangle content without the use of labels other than speaker identities. The efficacy of the proposed framework is validated via experiments conducted on the VoxCeleb and SITW datasets with 9.56% and 8.24% average reductions in EER and minDCF, respectively. Since neither additional model training nor data is specifically needed, it is easily applicable in practical use.

研究动机与目标

  • 为解决语音内容变化干扰说话人表征学习准确性的挑战。
  • 开发一种解缠框架,无需文本标签即可分离语音中的静态(说话人相关)与动态(内容相关)成分。
  • 设计一种自监督损失,仅使用说话人身份监督即可实现动态内容的解缠。
  • 构建一种轻量化、可部署的解决方案,避免预训练 ASR 模型或多任务训练带来的计算与数据开销。
  • 通过递归转移机制建模时序动态,提升说话人嵌入质量。

提出的方法

  • 该框架采用三个高斯推理层:第一层学习粗粒度的说话人表征,第二层通过动态转移模型实现内容解缠,第三层利用内容作为参考进一步优化说话人嵌入。
  • 引入强化的转移模型以捕捉复杂的语音动态,提升与内容相关成分的解缠效果。
  • 通过一种新型损失 $\mathcal{L}_{\rm ssp}$ 实现自监督,仅依赖说话人身份即可引导内容解缠,无需文本标注。
  • 该方法采用可学习的转移机制,通过潜在因子同时建模静态(说话人)与动态(内容)成分。
  • 框架通过端到端训练,静态层使用说话人分类损失,内容解缠部分使用自监督,实现无标签的内容建模。
  • 动态成分通过时间感知的转移层 $\mathbf{G}_{t}$ 建模,该层使用多个小规模转移模型以捕捉多样的声学变化。

实验结果

研究问题

  • RQ1是否可以在不使用文本标签或外部 ASR 模型的前提下,有效实现说话人表征与语音内容的解缠?
  • RQ2当仅能获取说话人身份时,如何利用自监督方法引导内容解缠?
  • RQ3相较于标准方法,采用强化转移模型的三层高斯推理架构是否能提升说话人识别性能?
  • RQ4所提出的自监督损失 $\mathcal{L}_{\rm ssp}$ 在多大程度上提升了解缠效果与下游识别准确率?
  • RQ5该框架能否实现轻量化与实用性,从而在无需额外模型或数据要求的情况下实现真实场景部署?

主要发现

  • 所提出的 RecXi 框架在 VoxCeleb 数据集上相比基线方法实现了 9.56% 的平均 EER 降低。
  • 在 SITW 数据集上,该框架实现了 8.24% 的平均 minDCF 降低,展现出一致的性能提升。
  • 自监督损失 $\mathcal{L}_{\rm ssp}$ 在所有 RecXi 系统中实现了 EER 与 minDCF 的平均降低 5.07%/5.44%,证明了其有效性。
  • 同时使用 $\tilde{\phi}$ 与 $\tilde{\phi}_{\rm lin}$ 特征的系统优于仅使用 $\tilde{\phi}$ 的系统,尤其在应用自监督时表现更优。
  • 当使用 $\mathcal{L}_{\rm ssp}$ 时,不同特征配置之间的性能差距被弥合,表明其在稳定与提升解缠效果方面具有关键作用。
  • 消融实验确认,所提出的 $\mathbf{G}_{t}$ 转移层在建模语音中动态成分方面既有效又必要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。