Skip to main content
QUICK REVIEW

[论文解读] Multilayer bootstrap network for unsupervised speaker recognition

Xiao-Lei Zhang|arXiv (Cornell University)|Sep 21, 2015
Speech and Audio Processing参考文献 15被引用 3
一句话总结

本文提出一种基于多层自举网络(MBN)的无监督说话人识别方法,通过非线性降维将通用背景模型(UBM)的高维超向量降维至低维空间,随后进行聚类。该方法在性能上优于无监督的PCA与k-me群方法,并接近有监督LDA的性能表现,且对UBM与MBN超参数设置具有较强的鲁棒性。

ABSTRACT

We apply multilayer bootstrap network (MBN), a recent proposed unsupervised learning method, to unsupervised speaker recognition. The proposed method first extracts supervectors from an unsupervised universal background model, then reduces the dimension of the high-dimensional supervectors by multilayer bootstrap network, and finally conducts unsupervised speaker recognition by clustering the low-dimensional data. The comparison results with 2 unsupervised and 1 supervised speaker recognition techniques demonstrate the effectiveness and robustness of the proposed method.

研究动机与目标

  • 开发一种无需人工标注训练数据的无监督说话人识别方法。
  • 解决在严格条件下无监督说话人识别的挑战:无需人工标注、最小化超参数调优,并在不同数据与建模条件下保持鲁棒性。
  • 在说话人识别任务中,提升对现有无监督方法(如PCA与k-means聚类)的性能表现。
  • 评估多层自举网络(MBN)在降维高维超向量以实现说话人聚类方面的有效性与鲁棒性。

提出的方法

  • 该方法首先从在MFCC特征上训练的无监督通用背景模型(UBM)中提取d维超向量。
  • 通过逐层非线性降维过程,利用多层自举网络(MBN)将超向量维度从d降低至更低的维度d̄(d̄ ≪ d)。
  • 每个MBN隐藏层对随机选取的、稀疏的特征子集执行k中心聚类,各聚类结果的输出经拼接后作为下一层的输入。
  • MBN训练过程包括:随机特征选择(由a = d̂/d控制)、随机中心初始化(k)、通过循环移位实现的随机重构(r = d′/d̂),以及通过最近邻分配实现的稀疏表示。
  • 最后,根据说话人数量是否已知,对低维MBN输出应用k-means或层次聚类以识别说话人。
  • 该方法通过归一化互信息(NMI)与分类准确率进行评估,并与PCA、k-means及基于LDA的系统进行对比。

实验结果

研究问题

  • RQ1该基于MBN的方法是否能在无需人工标注训练数据的情况下实现高精度的说话人识别?
  • RQ2与无监督基线方法(PCA与k-means)相比,该基于MBN的方法在聚类准确率与鲁棒性方面表现如何?
  • RQ3该基于MBN的方法对UBM超参数(如混合模型数量与EM迭代次数)变化的敏感程度如何?
  • RQ4MBN隐藏层的数量如何影响最终的说话人识别性能?

主要发现

  • 在所有测试的UBM配置下,基于MBN的方法在性能上均优于无监督的PCA与k-means聚类方法,实现了更高的归一化互信息(NMI)得分。
  • 该方法在最优设置下接近有监督LDA系统的表现,表明其在无监督说话人识别中具有极强的有效性。
  • 与PCA或k-means相比,该基于MBN的方法对UBM混合模型数量与EM迭代次数的变化表现出显著更低的敏感性,显示出更优的鲁棒性。
  • 增加MBN隐藏层的数量可稳定提升识别准确率,性能随层数增加而持续上升,直至五层时达到最佳。
  • 该方法在不同输出维度下均保持高性能,且对超参数设置具有强鲁棒性,尤其相较于PCA与k-means(对UBM与维度参数均表现出强烈敏感性)而言优势明显。
  • 通过PCA与MBN生成的可视化结果表明,MBN能产生更紧凑且更易分离的说话人聚类,尤其在UBM条件较差时(如EM迭代次数为0)表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。