Skip to main content
QUICK REVIEW

[论文解读] The ByteDance Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2021

Keke Wang, Xudong Mao|arXiv (Cornell University)|Sep 5, 2021
Speech Recognition and Synthesis参考文献 16被引用 9
一句话总结

本论文介绍了字节跳动在VoxSRC-2021挑战赛中的说话人分割系统,该系统结合了VAD、ECAPA-TDNN说话人嵌入、自动调优的谱聚类,以及通过层次聚类(AHC)进行的再聚类,使用pyannote检测重叠语音,并在多个时间尺度上采用DOVER-Lap融合。该系统在测试集上实现了5.15%的分割错误率(DER),在挑战赛中排名第二。

ABSTRACT

This paper describes the ByteDance speaker diarization system for the fourth track of the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC-21). The VoxSRC-21 provides both the dev set and test set of VoxConverse for use in validation and a standalone test set for evaluation. We first collect the duration and signal-to-noise ratio (SNR) of all audio and find that the distribution of the VoxConverse's test set and the VoxSRC-21's test set is more closer. Our system consists of voice active detection (VAD), speaker embedding extraction, spectral clustering followed by a re-clustering step based on agglomerative hierarchical clustering (AHC) and overlapped speech detection and handling. Finally, we integrate systems with different time scales using DOVER-Lap. Our best system achieves 5.15\% of the diarization error rate (DER) on evaluation set, ranking the second at the diarization track of the challenge.

研究动机与目标

  • 开发一个针对真实世界、野生环境音频的鲁棒说话人分割系统,其具有可变的噪声、语音重叠和录音条件。
  • 解决来自YouTube访谈和辩论的长时、嘈杂且存在语音重叠的语音片段中的说话人分割挑战。
  • 通过多尺度系统融合和有效处理重叠语音来提升分割性能。
  • 基于VoxConverse和VoxSRC-2021测试集中的信噪比(SNR)与时长分布的统计分析,优化聚类和VAD组件。
  • 通过系统性地选择和集成各组件,在VoxSRC-2021分割赛道实现最先进性能。

提出的方法

  • 系统使用pyannote 2.0中的VAD分离语音段,在VoxConverse dev2集上表现出最佳性能。
  • 说话人嵌入通过使用SpeechBrain训练并结合大量数据增强的ECAPA-TDNN模型提取。
  • 初始聚类通过在均匀分割的短片段(0.25s–0.75s位移)上进行谱聚类完成,随后通过基于AHC的再聚类优化说话人边界。
  • 使用在DIHARD3、AMI和VoxConverse dev1上预训练的pyannote模型检测重叠语音,阈值通过网格搜索调优。
  • 采用时间序列最近邻策略,在重叠发生前后,将重叠段分配给最近的两个说话人。
  • 通过在三个时间尺度(0.25s、0.5s、0.75s帧位移)上使用投票权重(0.4、0.3、0.3)的DOVER-Lap融合,提升系统鲁棒性与准确性。

实验结果

研究问题

  • RQ1VoxConverse dev2集与VoxSRC-2021评估集的信噪比(SNR)和音频时长分布有何异同?该差异是否影响模型泛化能力?
  • RQ2在存在可变噪声和语音重叠的条件下,多说话人分割中说话人嵌入提取与聚类的最佳时间尺度是什么?
  • RQ3当与自动调优的谱聚类和VAD过滤结合时,基于AHC的再聚类是否能提升分割性能?
  • RQ4DOVER-Lap融合方法在结合不同时间尺度的系统时,是否能有效降低DER和JER?
  • RQ5重叠语音检测与处理对整体分割性能的影响有多大?

主要发现

  • VoxConverse dev2集与VoxSRC-2021评估集在SNR和时长分布上具有相似性,支持将dev2作为主要验证集。
  • 最佳单系统(0.25s帧位移)在开发集上实现了4.33%的DER和23.80%的JER,优于粗粒度时间尺度的系统。
  • 通过DOVER-Lap融合,JER降低0.91%(至16.02%),DER相比最佳单系统提升0.05%,在评估集上达到5.15%的DER。
  • 使用0.047的阈值进行再聚类显著改善了DER,尤其在估计说话人数超过真实人数的情况下。
  • 发现语音增强会损害说话人嵌入质量,因此在最终系统中被排除,因其对DER有负面影响。
  • 重叠语音检测的精确率为76.85%,召回率为36.81%;开发集中仅有3.28%存在重叠,其中0.6%涉及三个或更多说话人。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。