Skip to main content
QUICK REVIEW

[论文解读] Advances in integration of end-to-end neural and clustering-based diarization for real conversational speech

Keisuke Kinoshita, Marc Delcroix|arXiv (Cornell University)|May 19, 2021
Speech Recognition and Synthesis参考文献 19被引用 4
一句话总结

本文提出EEND-vector聚类,一种混合说话人分割框架,将端到端神经分割与基于聚类的方法相结合,以处理具有重叠语音和任意数量说话人的长时真实对话语音。通过在固定长度片段上应用EEND,并使用约束聚类解决块间标签排列问题,该方法在CALLHOME数据集上实现了12.22%的SOTA DER(6名说话人),优于EDA-EEND和x-vector聚类。

ABSTRACT

Recently, we proposed a novel speaker diarization method called End-to-End-Neural-Diarization-vector clustering (EEND-vector clustering) that integrates clustering-based and end-to-end neural network-based diarization approaches into one framework. The proposed method combines advantages of both frameworks, i.e. high diarization performance and handling of overlapped speech based on EEND, and robust handling of long recordings with an arbitrary number of speakers based on clustering-based approaches. However, the method was only evaluated so far on simulated 2-speaker meeting-like data. This paper is to (1) report recent advances we made to this framework, including newly introduced robust constrained clustering algorithms, and (2) experimentally show that the method can now significantly outperform competitive diarization methods such as Encoder-Decoder Attractor (EDA)-EEND, on CALLHOME data which comprises real conversational speech data including overlapped speech and an arbitrary number of speakers. By further analyzing the experimental results, this paper also discusses pros and cons of the proposed method and reveals potential for further improvement. A set of the code to reproduce the results is available at https://github.com/nttcslab-sp/EEND-vector-clustering.

研究动机与目标

  • 解决现有分割方法在处理长录音、重叠语音及任意数量说话人时的局限性。
  • 在真实对话语音数据(特别是CALLHOME数据集)上评估EEND-vector聚类框架。
  • 通过改进的聚类技术与静音说话人检测,提升在真实场景下的鲁棒性。
  • 证明EEND与基于聚类方法的混合集成在真实数据上可实现更优性能。

提出的方法

  • 将输入语音按固定长度分块(例如15秒至50秒),以管理长录音。
  • 对每个块应用端到端神经分割(EEND),预测帧级说话人标签并提取全局说话人嵌入向量。
  • 使用约束凝聚聚类(约束AHC)算法,通过强制执行必须链接和不能链接约束,解决块间标签排列问题。
  • 使用EDA-EEND架构对每个块进行说话人数统计,将估计的说话人数用作聚类的引导。
  • 引入静音说话人检测以提升鲁棒性,通过识别跨块的非活跃说话人。
  • 约束聚类算法以所有块的说话人嵌入向量作为输入,约束来源于EEND预测结果,以保持说话人一致性。

实验结果

研究问题

  • RQ1EEND-vector聚类框架是否能在包含重叠语音和可变说话人数的真实对话语音数据(如CALLHOME)上实现更优性能?
  • RQ2在块间存在标签排列问题时,约束聚类相较于无约束或理想聚类,如何提升分割性能?
  • RQ3块大小对分割准确率有何影响,特别是在高说话人轮换的短块场景下?
  • RQ4在真实会议数据上,该方法与SOTA系统(如EDA-EEND、x-vector聚类和RPNSD)相比表现如何?

主要发现

  • 当使用30秒块时,EEND-vector聚类方法在CALLHOME数据(6名说话人)上实现了12.22%的分割错误率(DER),显著优于EDA-EEND(15.43%)和x-vector聚类(18.98%),且使用了理想说话人数。
  • 在使用估计说话人数时,该方法在30秒块下实现了12.49%的DER,优于EDA-EEND(15.29%)和x-vector聚类(19.43%)。
  • 约束AHC聚类表现最佳,尤其在6名说话人会话中,相比无约束AHC降低了2.29%的DER,且最接近理想聚类结果。
  • 块大小越小(如15秒),性能下降,表明在频繁说话人切换场景下面临挑战,尽管混淆错误增加程度高于漏检或误报。
  • 该方法对真实世界挑战(如噪声和混响)表现出鲁棒性,在长时复杂会议中性能优于基线EEND和x-vector聚类。
  • 结果表明,提升说话人嵌入准确性或聚类鲁棒性,即使在短块情况下,也能显著改善性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。