Skip to main content
QUICK REVIEW

[论文解读] CN-Celeb: multi-genre speaker recognition

Lantian Li, Ruiqi Liu|arXiv (Cornell University)|Dec 23, 2020
Speech Recognition and Synthesis参考文献 68被引用 9
一句话总结

本文介绍了 CN-Celeb,一个大规模多流派说话人识别语料库,涵盖 11 种流派的 3,000 位说话人,并对说话人识别中流派不匹配的影响进行了全面研究。基于 CN-Celeb2(520,000 条语音,2,000 位说话人)和 CN-Celeb1,作者证明了多流派训练可显著提升性能——使用 x-vector 系统时,等错误率(EER)从单流派训练的 16.59% 降低至多流派训练的 13.44%,凸显了跨流派数据在增强对会话间变化鲁棒性方面的重要作用。

ABSTRACT

Research on speaker recognition is extending to address the vulnerability in the wild conditions, among which genre mismatch is perhaps the most challenging, for instance, enrollment with reading speech while testing with conversational or singing audio. This mismatch leads to complex and composite inter-session variations, both intrinsic (i.e., speaking style, physiological status) and extrinsic (i.e., recording device, background noise). Unfortunately, the few existing multi-genre corpora are not only limited in size but are also recorded under controlled conditions, which cannot support conclusive research on the multi-genre problem. In this work, we firstly publish CN-Celeb, a large-scale multi-genre corpus that includes in-the-wild speech utterances of 3,000 speakers in 11 different genres. Secondly, using this dataset, we conduct a comprehensive study on the multi-genre phenomenon, in particular the impact of the multi-genre challenge on speaker recognition and the performance gain when the new dataset is used to conduct multi-genre training.

研究动机与目标

  • 为解决说话人识别中流派不匹配这一关键挑战,即注册与测试条件存在显著差异(例如,朗读与演唱)。
  • 通过引入 CN-Celeb2,克服现有语料库规模小且在受控条件下录制的局限,构建一个大规模真实环境下的多流派数据集。
  • 研究最先进系统在多流派条件下的性能退化情况,并评估多流派训练的有效性。
  • 确定部分或全部多流派数据采集是否能为说话人识别系统带来有意义的性能提升。

提出的方法

  • 作者收集并发布了 CN-Celeb2,一个大规模多流派语料库,包含来自 2,000 位中文名人、11 种流派的 520,000 条语音,涵盖真实环境和受控录制的语音。
  • 他们将 CN-Celeb2 与先前发布的 CN-Celeb1(1,000 位说话人,270 小时)结合,形成完整的 CN-Celeb 语料库,用于全面的训练与评估。
  • 他们使用 i-vector 和 x-vector 前端模型结合 PLDA 后端评分方法,对比单流派(SG)和多流派(MG)训练方案,评估说话人识别性能。
  • 他们通过消融实验对比完整 MG 训练(含跨流派说话人)、部分 MG 训练(不含跨流派说话人)和 SG 训练,以隔离流派多样性的影响。
  • 他们使用余弦相似度和等错误率(EER)作为主要指标,评估不同训练与测试条件下系统的鲁棒性。
  • 他们分析了数据不平衡以及训练集与测试集之间一致性的影响,特别是对 i-vector 等生成模型的影响。

实验结果

研究问题

  • RQ1在真实世界、真实环境条件下,流派不匹配如何影响最先进说话人识别系统的性能?
  • RQ2多流派训练在多大程度上能提升说话人识别系统对会话间变化的鲁棒性?
  • RQ3在缺乏跨流派说话人的情况下,部分多流派数据(与单流派训练相比)是否仍能带来性能提升?
  • RQ4前端模型(i-vector/x-vector)与后端模型(PLDA)如何从多流派训练中获益?哪个组件的性能提升最大?
  • RQ5在多流派场景下,数据规模、流派多样性与训练一致性对系统泛化能力的相对影响如何?

主要发现

  • 多流派训练显著提升了说话人识别性能,使用 PLDA 评分的 x-vector 系统中,EER 从单流派训练的 16.59% 降低至 13.44%。
  • i-vector 系统在使用 MG 训练时,EER 提升了 1.58%(从 20.88% 降至 19.29%),表明数据一致性具有优势。
  • 即使不包含跨流派说话人,部分多流派训练仍优于单流派训练,x-vector 系统的 EER 从 16.59% 降低至 14.76%,表明多流派数据即使未完全覆盖,也具有价值。
  • 前端与后端模型均在多流派数据上进行完整 MG 训练时性能最佳,x-vector 系统的 EER 为 13.44%,i-vector 系统为 14.81%。
  • SG 与 MG 训练之间的性能差距在 x-vector 系统中更为显著(EER 分别为 20.35% 和 20.13%),表明当训练数据平衡时,深度学习模型更能从多流派数据中获益。
  • 本研究证实,多流派挑战是真实世界说话人识别中的主要瓶颈,当从 SITW 切换到 CN-Celeb 时,EER 从 3.75% 上升至 15.52%,性能下降了 300%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。