Skip to main content
QUICK REVIEW

[论文解读] Prosodic-Enhanced Siamese Convolutional Neural Networks for Cross-Device Text-Independent Speaker Verification

Sobhan Soleymani, Ali Dabouei|arXiv (Cornell University)|Jul 31, 2018
Speech Recognition and Synthesis参考文献 17被引用 5
一句话总结

本文提出了一种增强语音韵律的孪生卷积神经网络,用于跨设备、与文本无关的说话人验证,通过CNN-MLP融合方法联合学习梅尔频率倒谱系数(Mel-frequency spectrogram)和韵律特征(jitter, shimmer, 基频),在FBI语音库2016年数据集上实现了13.11%的EER,优于最先进的方法,包括i-vector/PLDA以及Nagrani等人(2017年)的深度神经网络架构。

ABSTRACT

In this paper a novel cross-device text-independent speaker verification architecture is proposed. Majority of the state-of-the-art deep architectures that are used for speaker verification tasks consider Mel-frequency cepstral coefficients. In contrast, our proposed Siamese convolutional neural network architecture uses Mel-frequency spectrogram coefficients to benefit from the dependency of the adjacent spectro-temporal features. Moreover, although spectro-temporal features have proved to be highly reliable in speaker verification models, they only represent some aspects of short-term acoustic level traits of the speaker's voice. However, the human voice consists of several linguistic levels such as acoustic, lexicon, prosody, and phonetics, that can be utilized in speaker verification models. To compensate for these inherited shortcomings in spectro-temporal features, we propose to enhance the proposed Siamese convolutional neural network architecture by deploying a multilayer perceptron network to incorporate the prosodic, jitter, and shimmer features. The proposed end-to-end verification architecture performs feature extraction and verification simultaneously. This proposed architecture displays significant improvement over classical signal processing approaches and deep algorithms for forensic cross-device speaker verification.

研究动机与目标

  • 解决时频特征在捕捉说话人验证中长期韵律与语言特征方面的局限性。
  • 在设备与信道不匹配条件下,提升跨设备、与文本无关的说话人验证性能。
  • 开发一种端到端的深度学习架构,联合提取并融合频谱图与韵律特征,无需手工特征工程。
  • 通过孪生网络与对比损失,实现直接成对比较,消除对单独注册与验证阶段的需求。

提出的方法

  • 使用梅尔频率倒谱系数(MFSCs)代替MFCCs,以保留相邻时频特征之间的时序相关性。
  • 部署多层感知机(MLP)以提取并表示韵律特征,包括基频、jitter与shimmer。
  • 将基于CNN的频谱图表征与基于MLP的韵律表征融合至共享的孪生架构中。
  • 使用具有10 margin的对比损失进行端到端模型训练,最小化类内距离并最大化类间距离。
  • 在测试阶段,通过计算多个短语音对之间的平均欧氏距离来评估说话人间相似度,并通过均值与标准差滤波实现异常值剔除。
  • 对CNN与韵律网络的得分进行层级融合,并在信道无关与信道相关两种设置下进行评估。

实验结果

研究问题

  • RQ1在深度孪生网络中,将jitter、shimmer与F0等韵律特征与时频特征融合,能否提升说话人验证性能?
  • RQ2与MFCCs相比,使用梅尔频率倒谱图是否能在跨设备、与文本无关的说话人验证中带来更好的性能?
  • RQ3端到端的孪生CNN-MLP架构能否在法医说话人验证中超越传统的i-vector/PLDA以及最先进的深度学习基线方法?
  • RQ4在信道相关与信道无关设置下,该模型在不同设备类型(麦克风、DVR、手机)上的性能表现如何?

主要发现

  • 所提出的耦合网络在FBI语音库2016年数据集上实现了13.11%的EER,显著优于使用MFSC的i-vector/PLDA(15.79% EER)与MFCC(15.26% EER)。
  • 模型AUC达到0.9358,超过次优方法(Nagrani等人,2017年)的0.9215 AUC。
  • 在信道相关设置下,麦克风到麦克风的验证性能最佳(EER为0.0712),表明模型对特定设备特性的适应能力更强。
  • 仅使用韵律特征的网络表现较差(EER为16.73%),证实仅靠韵律特征不足以实现有效识别,但其与CNN特征的融合可显著提升性能。
  • CNN与韵律网络的得分级融合得到15.78%的EER,表明互补特征表征的结合可提升模型鲁棒性。
  • 模型在低质量设备上表现最弱(如手机到手机,EER为13.16%),凸显在真实法医应用中设备特定适应的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。