[论文解读] The ByteDance Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2021
本论文介绍了字节跳动在VoxSRC-2021挑战赛中的说话人分割系统,该系统结合了VAD、ECAPA-TDNN说话人嵌入、自动调优的谱聚类,以及通过层次聚类(AHC)进行的再聚类,使用pyannote检测重叠语音,并在多个时间尺度上采用DOVER-Lap融合。该系统在测试集上实现了5.15%的分割错误率(DER),在挑战赛中排名第二。
This paper describes the ByteDance speaker diarization system for the fourth track of the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC-21). The VoxSRC-21 provides both the dev set and test set of VoxConverse for use in validation and a standalone test set for evaluation. We first collect the duration and signal-to-noise ratio (SNR) of all audio and find that the distribution of the VoxConverse's test set and the VoxSRC-21's test set is more closer. Our system consists of voice active detection (VAD), speaker embedding extraction, spectral clustering followed by a re-clustering step based on agglomerative hierarchical clustering (AHC) and overlapped speech detection and handling. Finally, we integrate systems with different time scales using DOVER-Lap. Our best system achieves 5.15\% of the diarization error rate (DER) on evaluation set, ranking the second at the diarization track of the challenge.
研究动机与目标
- 开发一个针对真实世界、野生环境音频的鲁棒说话人分割系统,其具有可变的噪声、语音重叠和录音条件。
- 解决来自YouTube访谈和辩论的长时、嘈杂且存在语音重叠的语音片段中的说话人分割挑战。
- 通过多尺度系统融合和有效处理重叠语音来提升分割性能。
- 基于VoxConverse和VoxSRC-2021测试集中的信噪比(SNR)与时长分布的统计分析,优化聚类和VAD组件。
- 通过系统性地选择和集成各组件,在VoxSRC-2021分割赛道实现最先进性能。
提出的方法
- 系统使用pyannote 2.0中的VAD分离语音段,在VoxConverse dev2集上表现出最佳性能。
- 说话人嵌入通过使用SpeechBrain训练并结合大量数据增强的ECAPA-TDNN模型提取。
- 初始聚类通过在均匀分割的短片段(0.25s–0.75s位移)上进行谱聚类完成,随后通过基于AHC的再聚类优化说话人边界。
- 使用在DIHARD3、AMI和VoxConverse dev1上预训练的pyannote模型检测重叠语音,阈值通过网格搜索调优。
- 采用时间序列最近邻策略,在重叠发生前后,将重叠段分配给最近的两个说话人。
- 通过在三个时间尺度(0.25s、0.5s、0.75s帧位移)上使用投票权重(0.4、0.3、0.3)的DOVER-Lap融合,提升系统鲁棒性与准确性。
实验结果
研究问题
- RQ1VoxConverse dev2集与VoxSRC-2021评估集的信噪比(SNR)和音频时长分布有何异同?该差异是否影响模型泛化能力?
- RQ2在存在可变噪声和语音重叠的条件下,多说话人分割中说话人嵌入提取与聚类的最佳时间尺度是什么?
- RQ3当与自动调优的谱聚类和VAD过滤结合时,基于AHC的再聚类是否能提升分割性能?
- RQ4DOVER-Lap融合方法在结合不同时间尺度的系统时,是否能有效降低DER和JER?
- RQ5重叠语音检测与处理对整体分割性能的影响有多大?
主要发现
- VoxConverse dev2集与VoxSRC-2021评估集在SNR和时长分布上具有相似性,支持将dev2作为主要验证集。
- 最佳单系统(0.25s帧位移)在开发集上实现了4.33%的DER和23.80%的JER,优于粗粒度时间尺度的系统。
- 通过DOVER-Lap融合,JER降低0.91%(至16.02%),DER相比最佳单系统提升0.05%,在评估集上达到5.15%的DER。
- 使用0.047的阈值进行再聚类显著改善了DER,尤其在估计说话人数超过真实人数的情况下。
- 发现语音增强会损害说话人嵌入质量,因此在最终系统中被排除,因其对DER有负面影响。
- 重叠语音检测的精确率为76.85%,召回率为36.81%;开发集中仅有3.28%存在重叠,其中0.6%涉及三个或更多说话人。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。