[论文解读] Fully Supervised Speaker Diarization
本文提出一种使用无界交错状态RNN(UIS-RNN)的完全监督说话人分割系统,通过共享RNN对每位说话人进行建模,并采用时间交错的隐藏状态,同时结合距离依赖的中国餐馆过程(ddCRP)以处理未知数量的说话人。该方法在NIST SRE 2000 CALLHOME数据集上实现了7.6%的分割错误率(DER),优于最先进的谱聚类方法,同时支持在线推理。
In this paper, we propose a fully supervised speaker diarization approach, named unbounded interleaved-state recurrent neural networks (UIS-RNN). Given extracted speaker-discriminative embeddings (a.k.a. d-vectors) from input utterances, each individual speaker is modeled by a parameter-sharing RNN, while the RNN states for different speakers interleave in the time domain. This RNN is naturally integrated with a distance-dependent Chinese restaurant process (ddCRP) to accommodate an unknown number of speakers. Our system is fully supervised and is able to learn from examples where time-stamped speaker labels are annotated. We achieved a 7.6% diarization error rate on NIST SRE 2000 CALLHOME, which is better than the state-of-the-art method using spectral clustering. Moreover, our method decodes in an online fashion while most state-of-the-art systems rely on offline clustering.
研究动机与目标
- 通过使用时间戳说话人标签进行训练,解决无监督聚类在说话人分割中的局限性。
- 开发一种可训练的在线分割系统,从完全监督的样本中学习。
- 利用贝叶斯非参数方法处理每句话中未知数量的说话人。
- 通过端到端学习结合d-vectors,提升分割性能,超越现有基于聚类的方法。
- 在保持与离线聚类方法相当性能的同时,实现在线解码。
提出的方法
- 使用参数共享的循环神经网络(RNN)对每位说话人进行建模,不同说话人的隐藏状态在时间上交错排列。
- 采用距离依赖的中国餐馆过程(ddCRP)以支持无界数量的说话人,并动态学习说话人数量。
- 将观测值与标签的联合概率建模为序列生成模型:$ p( extbf{X}, extbf{Y}, extbf{Z}) = p( extbf{x}_1,y_1) imes extstyleigprod_{t=2}^T p( extbf{x}_t,y_t,z_t| extbf{x}_{[t-1]},y_{[t-1]},z_{[t-1]}) $,其中 $ z_t $ 表示说话人切换。
- 使用真实说话人标签进行监督学习,端到端训练UIS-RNN模型。
- 将预训练说话人识别网络输出的说话人嵌入(d-vectors)作为UIS-RNN的输入。
- 通过顺序处理语音段实现在线推理,保持实时处理能力。
![Fig. 1 : The baseline system architecture [ 3 ] .](https://ar5iv.labs.arxiv.org/html/1810.04719/assets/x1.png)
实验结果
研究问题
- RQ1当具备时间戳标签时,完全监督的RNN方法是否能优于无监督聚类方法进行说话人分割?
- RQ2无界、交错状态的RNN模型是否能无需先验知识,动态学习说话人数量?
- RQ3使用可训练序列模型进行在线推理,是否能达到与离线聚类方法相当的性能?
- RQ4在域内和域外数据上进行训练,如何影响UIS-RNN系统的泛化能力和性能?
- RQ5该UIS-RNN框架是否可扩展至使用原始声学特征而非预提取的d-vectors进行端到端学习?
主要发现
- 在NIST SRE 2000 CALLHOME基准上,UIS-RNN系统在域内5折交叉验证及额外域外数据下,实现了7.6%的分割错误率(DER)。
- 该方法优于谱聚类(使用相同d-vectors时为8.8% DER)和k-means聚类,证明了完全监督训练的优势。
- 当使用d-vector V3(训练与推理窗口大小一致)时,性能显著提升,k-means的DER从V1的12.3%降低至V3的8.5%。
- 在域外数据(Disk-6 + ICSI)上进行训练,DER降低至8.2%(V3),而结合域内与域外数据后,DER进一步降低至7.6%。
- UIS-RNN系统支持在线推理,性能与离线聚类算法相当或更优,打破了速度与精度之间的权衡。
- 所提出的框架具有通用性,可扩展至说话人分割之外的应用,如基于视频的人脸聚类,得益于其序列聚类设计。
![Fig. 2 : Generative process of UIS-RNN. Colors indicate labels for speaker segments. There are four options for $y_{7}$ given $\mathbf{x}_{[6]},y_{[6]}$ .](https://ar5iv.labs.arxiv.org/html/1810.04719/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。