[论文解读] DeepVOX: Discovering Features from Raw Audio for Speaker Recognition in Degraded Audio Signals.
该论文提出 DeepVOX,一种一维卷积神经网络,可直接从原始语音音频中学习时域滤波器组,以提取对语音退化具有鲁棒性的特征。通过使用自适应三元组挖掘和端到端训练,DeepVOX 同时捕捉了发声源和声道特征,在多种数据集和退化类型下,其性能优于传统滤波器组,并显著提升了 xVector-PLDA 和 iVector-PLDA 等现有说话人识别系统的表现。
Automatic speaker recognition algorithms typically use pre-defined filterbanks, such as Mel-Frequency and Gammatone filterbanks, for characterizing speech audio. The design of these filterbanks is based on domain-knowledge and limited empirical observations. The resultant features, therefore, may not generalize well to different types of audio degradation. In this work, we propose a deep learning-based technique to induce the filterbank design from vast amounts of speech audio. The purpose of such a filterbank is to extract features robust to degradations in the input audio. To this effect, a 1D convolutional neural network is designed to learn a time-domain filterbank called DeepVOX directly from raw speech audio. Secondly, an adaptive triplet mining technique is developed to efficiently mine the data samples best suited to train the filterbank. Thirdly, a detailed ablation study of the DeepVOX filterbanks reveals the presence of both vocal source and vocal tract characteristics in the extracted features. Experimental results on VOXCeleb2, NIST SRE 2008 and 2010, and Fisher speech datasets demonstrate the efficacy of the DeepVOX features across a variety of audio degradations, multi-lingual speech data, and varying-duration speech audio. The DeepVOX features also improve the performance of existing speaker recognition algorithms, such as the xVector-PLDA and the iVector-PLDA.
研究动机与目标
- 开发一种数据驱动的滤波器组,使其在各种语音退化条件下,泛化能力优于手工设计的滤波器组(如梅尔频率和伽马 Tone 滤波器组)。
- 直接从原始语音音频中学习时域滤波器组,而无需依赖特定领域假设。
- 通过端到端特征学习,提升在低质量或噪声语音条件下的说话人识别性能。
- 通过集成学习到的 DeepVOX 特征,增强现有说话人识别系统(如 xVector-PLDA 和 iVector-PLDA)的性能。
提出的方法
- 在原始语音音频上端到端训练一维卷积神经网络,以学习名为 DeepVOX 的时域滤波器组。
- 采用自适应三元组挖掘策略,高效选择具有挑战性的训练样本,以最大化特征的判别能力。
- 使用对比损失目标函数进行滤波器组训练,以促进同说话人特征的紧凑性和不同说话人特征的可分性。
- 消融研究显示,所学习的滤波器组同时捕捉了发声源和声道特征。
- 在 VOXCeleb2、NIST SRE 2008 和 2010、Fisher 等多个数据集上,于多种语音退化条件下评估该方法。
- 将 DeepVOX 特征集成到标准说话人识别流程中,以评估性能提升效果。
实验结果
研究问题
- RQ1基于深度学习的滤波器组若直接从原始语音中训练,是否能在语音退化条件下优于传统手工设计的滤波器组?
- RQ2所学习的滤波器组特征中编码了哪些说话人特征(例如发声源、声道特征)?
- RQ3自适应三元组挖掘策略如何提升所学习滤波器组的鲁棒性和泛化能力?
- RQ4DeepVOX 特征在多大程度上提升了 xVector-PLDA 和 iVector-PLDA 等现有说话人识别系统?
- RQ5该方法在多语言数据和不同语音时长下是否具有良好的泛化能力?
主要发现
- 在 VOXCeleb2、NIST SRE 2008 和 2010、Fisher 等数据集上,DeepVOX 特征在多种语音退化条件下均表现出更优性能。
- 消融研究证实,DeepVOX 特征同时编码了发声源和声道特征。
- 自适应三元组挖掘技术显著提升了模型从原始语音中学习判别性特征的能力。
- DeepVOX 特征可有效提升 xVector-PLDA 和 iVector-PLDA 系统的性能,表明其具备良好的兼容性和增强潜力。
- 该方法在多语言语音数据和不同语音时长下均表现出良好泛化能力,表明对输入可变性具有鲁棒性。
- 在退化条件下,所学习的滤波器组在说话人识别准确率方面优于梅尔频率和伽马 Tone 滤波器组。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。