Skip to main content
QUICK REVIEW

[论文解读] Deep Speaker Vector Normalization with Maximum Gaussianality Training

Yunqi Cai, Lantian Li|arXiv (Cornell University)|Oct 30, 2020
Speech Recognition and Synthesis参考文献 48被引用 4
一句话总结

本文提出针对基于深度归一化流(DNF)的说话人向量归一化模型的极大高斯性(MG)训练方法,直接优化潜在码的高斯性,而非依赖最大似然(ML)训练。MG方法通过强制实现类间分布的球形化和类内方差的一致性,显著提升了说话人识别性能,尤其在余弦相似度评分下表现突出,在域内(SITW)和域外(CNCeleb)数据集上均优于基于ML的DNF模型,即使在低数据量条件下也取得了显著提升。

ABSTRACT

Deep speaker embedding represents the state-of-the-art technique for speaker recognition. A key problem with this approach is that the resulting deep speaker vectors tend to be irregularly distributed. In previous research, we proposed a deep normalization approach based on a new discriminative normalization flow (DNF) model, by which the distributions of individual speakers are arguably transformed to homogeneous Gaussians. This normalization was demonstrated to be effective, but despite this remarkable success, we empirically found that the latent codes produced by the DNF model are generally neither homogeneous nor Gaussian, although the model has assumed so. In this paper, we argue that this problem is largely attributed to the maximum-likelihood (ML) training criterion of the DNF model, which aims to maximize the likelihood of the observations but not necessarily improve the Gaussianality of the latent codes. We therefore propose a new Maximum Gaussianality (MG) training approach that directly maximizes the Gaussianality of the latent codes. Our experiments on two data sets, SITW and CNCeleb, demonstrate that our new MG training approach can deliver much better performance than the previous ML training, and exhibits improved domain generalizability, particularly with regard to cosine scoring.

研究动机与目标

  • 为解决基于最大似然(ML)训练的DNF模型存在的局限性,即尽管模型假设潜在码为线性高斯分布,但实际训练中无法确保其高斯性。
  • 通过直接最大化潜在码的高斯性,改进说话人向量归一化方法,使其与理想PLDA评分假设保持一致。
  • 通过采用更合理的训练准则,提升模型性能与泛化能力,特别是在低数据量或域外设置下。
  • 证明MG训练相比基于ML的DNF模型能实现更优性能,尤其在余弦相似度评分下表现更优,后者对数据不匹配更具鲁棒性。

提出的方法

  • 提出一种新型训练准则——最大高斯性(MG),直接最大化DNF模型生成的潜在码的高斯性。
  • 用基于高斯性优化的目标替代标准的最大似然(ML)目标,采用Mardia的多变量峰度等统计量来量化高斯性。
  • 将MG训练应用于类间与类内分布,强制实现类间均值的球形分布与类内方差的一致性。
  • 利用可逆流模型(DNF)将说话人嵌入转换为具有更优分布特性的归一化潜在码。
  • 采用两阶段训练策略:首先在MG准则下归一化类内分布,随后在MG准则下归一化类间均值。
  • 支持任意可逆流结构的应用,无需显式计算熵,简化了模型设计与训练过程。

实验结果

研究问题

  • RQ1在基于DNF的说话人归一化中,通过最大化潜在码的高斯性,是否能超越最大似然训练的性能?
  • RQ2MG训练是否能提升在域外数据集上的泛化能力,尤其是在使用余弦相似度评分时?
  • RQ3在低数据量场景(如每名说话人仅2段语音)下,MG训练对性能有何影响?
  • RQ4与PLDA评分相比,MG归一化在多大程度上提升了余弦相似度评分的有效性?
  • RQ5MG训练能否同时有效应用于类内与类间分布的联合优化?

主要发现

  • 在SITW数据集上,MG训练使说话人识别性能显著提升,域内测试中等错误率(EER)相对降低了31%,优于基于ML的DNF模型。
  • 在CNCeleb域外测试中,MG归一化的DNF模型实现9.3%的相对EER降低,展现出强大的域泛化能力。
  • 当每名说话人仅提供2段语音时,MG训练仍保持高性能,而基于ML的DNF模型性能趋于饱和,表明其在低数据场景下具有更强的鲁棒性。
  • 使用MG归一化向量进行余弦相似度评分,性能可与或优于PLDA评分,尤其在域外设置下表现更优,归因于对数据不匹配的更低敏感性。
  • 通过MG准则对类间与类内分布进行联合归一化,实现了最高的性能增益,证实了完整分布正则化的必要性。
  • MG准则使无需显式计算熵即可有效训练流模型,从而拓展了其在各类可逆架构中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。