Skip to main content
QUICK REVIEW

[论文解读] Fully Supervised Speaker Diarization

Aonan Zhang, Quan Wang|arXiv (Cornell University)|Oct 10, 2018
Speech Recognition and Synthesis参考文献 24被引用 8
一句话总结

本文提出一种使用无界交错状态RNN(UIS-RNN)的完全监督说话人分割系统,通过共享RNN对每位说话人进行建模,并采用时间交错的隐藏状态,同时结合距离依赖的中国餐馆过程(ddCRP)以处理未知数量的说话人。该方法在NIST SRE 2000 CALLHOME数据集上实现了7.6%的分割错误率(DER),优于最先进的谱聚类方法,同时支持在线推理。

ABSTRACT

In this paper, we propose a fully supervised speaker diarization approach, named unbounded interleaved-state recurrent neural networks (UIS-RNN). Given extracted speaker-discriminative embeddings (a.k.a. d-vectors) from input utterances, each individual speaker is modeled by a parameter-sharing RNN, while the RNN states for different speakers interleave in the time domain. This RNN is naturally integrated with a distance-dependent Chinese restaurant process (ddCRP) to accommodate an unknown number of speakers. Our system is fully supervised and is able to learn from examples where time-stamped speaker labels are annotated. We achieved a 7.6% diarization error rate on NIST SRE 2000 CALLHOME, which is better than the state-of-the-art method using spectral clustering. Moreover, our method decodes in an online fashion while most state-of-the-art systems rely on offline clustering.

研究动机与目标

  • 通过使用时间戳说话人标签进行训练,解决无监督聚类在说话人分割中的局限性。
  • 开发一种可训练的在线分割系统,从完全监督的样本中学习。
  • 利用贝叶斯非参数方法处理每句话中未知数量的说话人。
  • 通过端到端学习结合d-vectors,提升分割性能,超越现有基于聚类的方法。
  • 在保持与离线聚类方法相当性能的同时,实现在线解码。

提出的方法

  • 使用参数共享的循环神经网络(RNN)对每位说话人进行建模,不同说话人的隐藏状态在时间上交错排列。
  • 采用距离依赖的中国餐馆过程(ddCRP)以支持无界数量的说话人,并动态学习说话人数量。
  • 将观测值与标签的联合概率建模为序列生成模型:$ p( extbf{X}, extbf{Y}, extbf{Z}) = p( extbf{x}_1,y_1) imes extstyleigprod_{t=2}^T p( extbf{x}_t,y_t,z_t| extbf{x}_{[t-1]},y_{[t-1]},z_{[t-1]}) $,其中 $ z_t $ 表示说话人切换。
  • 使用真实说话人标签进行监督学习,端到端训练UIS-RNN模型。
  • 将预训练说话人识别网络输出的说话人嵌入(d-vectors)作为UIS-RNN的输入。
  • 通过顺序处理语音段实现在线推理,保持实时处理能力。
Fig. 1 : The baseline system architecture [ 3 ] .
Fig. 1 : The baseline system architecture [ 3 ] .

实验结果

研究问题

  • RQ1当具备时间戳标签时,完全监督的RNN方法是否能优于无监督聚类方法进行说话人分割?
  • RQ2无界、交错状态的RNN模型是否能无需先验知识,动态学习说话人数量?
  • RQ3使用可训练序列模型进行在线推理,是否能达到与离线聚类方法相当的性能?
  • RQ4在域内和域外数据上进行训练,如何影响UIS-RNN系统的泛化能力和性能?
  • RQ5该UIS-RNN框架是否可扩展至使用原始声学特征而非预提取的d-vectors进行端到端学习?

主要发现

  • 在NIST SRE 2000 CALLHOME基准上,UIS-RNN系统在域内5折交叉验证及额外域外数据下,实现了7.6%的分割错误率(DER)。
  • 该方法优于谱聚类(使用相同d-vectors时为8.8% DER)和k-means聚类,证明了完全监督训练的优势。
  • 当使用d-vector V3(训练与推理窗口大小一致)时,性能显著提升,k-means的DER从V1的12.3%降低至V3的8.5%。
  • 在域外数据(Disk-6 + ICSI)上进行训练,DER降低至8.2%(V3),而结合域内与域外数据后,DER进一步降低至7.6%。
  • UIS-RNN系统支持在线推理,性能与离线聚类算法相当或更优,打破了速度与精度之间的权衡。
  • 所提出的框架具有通用性,可扩展至说话人分割之外的应用,如基于视频的人脸聚类,得益于其序列聚类设计。
Fig. 2 : Generative process of UIS-RNN. Colors indicate labels for speaker segments. There are four options for $y_{7}$ given $\mathbf{x}_{[6]},y_{[6]}$ .
Fig. 2 : Generative process of UIS-RNN. Colors indicate labels for speaker segments. There are four options for $y_{7}$ given $\mathbf{x}_{[6]},y_{[6]}$ .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。