[论文解读] CN-CELEB: a challenging Chinese speaker recognition dataset
本文提出了 CN-Celeb,一个大规模、真实场景下的中文说话人识别数据集,包含来自1,000位名人、横跨11种不同流派的超过130,000段语音。实验表明,即使是最先进的i-vector和x-vector系统在CN-Celeb上的表现(EER最高达19.05%)也远差于在VoxCeleb上的表现,表明真实世界条件带来的挑战远超以往的预期。
Recently, researchers set an ambitious goal of conducting speaker recognition in unconstrained conditions where the variations on ambient, channel and emotion could be arbitrary. However, most publicly available datasets are collected under constrained environments, i.e., with little noise and limited channel variation. These datasets tend to deliver over optimistic performance and do not meet the request of research on speaker recognition in unconstrained conditions. In this paper, we present CN-Celeb, a large-scale speaker recognition dataset collected `in the wild'. This dataset contains more than 130,000 utterances from 1,000 Chinese celebrities, and covers 11 different genres in real world. Experiments conducted with two state-of-the-art speaker recognition approaches (i-vector and x-vector) show that the performance on CN-Celeb is far inferior to the one obtained on VoxCeleb, a widely used speaker recognition dataset. This result demonstrates that in real-life conditions, the performance of existing techniques might be much worse than it was thought. Our database is free for researchers and can be downloaded from http://project.cslt.org.
研究动机与目标
- 为解决当前在非受限环境下缺乏真实、多样且大规模的说话人识别数据集的问题。
- 提供一个专注于中文说话人的基准数据集,涵盖真实世界中在流派、信道和环境条件方面的多样性。
- 证明即使是最先进的说话人识别系统,在真实世界条件下的表现也远差于在受限数据集上的表现。
- 提供一个与VoxCeleb互补的数据集,强调语言和流派多样性,以实现更稳健的模型评估。
提出的方法
- 使用计算机视觉技术(包括人脸检测、跟踪和音视频同步)重新实现VoxCeleb的自动化数据采集流程。
- 从11种真实世界流派(如访谈、演唱、戏剧和vlog)中收集了1,000位中国名人的语音数据。
- 采用两阶段数据筛选策略:先进行自动化预筛选,再通过人工验证,以提升复杂流派中的数据质量。
- 使用标准前端(GMM-UBM 和 DNN)与后端(LDA-PLDA)流程训练i-vector和x-vector系统以进行评估。
- 使用等错误率(EER)作为主要指标,用于跨数据集比较,包括SITW和重新分割版本,以确保公平比较。
- 通过在CN-Celeb、VoxCeleb和混合数据上单独训练系统,开展消融研究,以评估模型的泛化能力与数据集难度。
实验结果
研究问题
- RQ1CN-Celeb上的说话人识别性能与广泛使用的基准数据集VoxCeleb相比如何?
- RQ2流派多样性与真实世界录音条件在多大程度上降低了最先进说话人识别系统的性能?
- RQ3在VoxCeleb上训练的模型能否良好泛化到像CN-Celeb这样语言和声学特性多样的新数据集?
- RQ4当在相同具有挑战性的测试集上评估时,仅在CN-Celeb上训练的模型是否比在VoxCeleb上训练的模型泛化能力更好?
- RQ5在以自动化为主的数据管道中引入人工验证数据,对说话人识别系统的鲁棒性有何影响?
主要发现
- i-vector系统在CN-Celeb(E)上的EER为19.05%,而SITW(S)上为7.30%,表明在真实世界条件下性能出现显著下降。
- x-vector系统在CN-Celeb(E)上的EER为15.52%,远差于SITW(S)上的4.78%,证实了该数据集的难度显著提升。
- 即使在使用较小的、可比的VoxCeleb子集(VoxCeleb(L))重新训练后端模型后,系统在SITW(S)上仍达到11.34%的EER,优于仅在CN-Celeb(T)上训练的系统(14.24% EER)。
- 仅在CN-Celeb数据上训练的CN-Celeb(T)系统在CN-Celeb(E)上达到14.24%的EER,表明尽管是同源训练,其泛化能力依然很差。
- CN-Celeb与VoxCeleb之间的性能差距表明,当前说话人识别模型在真实世界、非受限环境中的鲁棒性,远低于以往的预期。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。