Skip to main content
QUICK REVIEW

[论文解读] Glottal Closure Instants Detection From Pathological Acoustic Speech Signal Using Deep Learning

M Gurunath Reddy, Tanumay Mandal|arXiv (Cornell University)|Nov 25, 2018
Voice and Speech Disorders参考文献 15被引用 14
一句话总结

本文提出一种基于深度学习的方法,利用原始语音信号和线性预测残差(LPR)特征,通过多通道卷积神经网络(CNN)架构融合,实现对病理性语音中声门关闭瞬时(GCI)的检测。该方法在包含人工标注GCI的新型病理性语音数据集上,实现了89.30%的识别率和0.54ms的定时精度,显著优于现有最先进方法。

ABSTRACT

In this paper, we propose a classification based glottal closure instants (GCI) detection from pathological acoustic speech signal, which finds many applications in vocal disorder analysis. Till date, GCI for pathological disorder is extracted from laryngeal (glottal source) signal recorded from Electroglottograph, a dedicated device designed to measure the vocal folds vibration around the larynx. We have created a pathological dataset which consists of simultaneous recordings of glottal source and acoustic speech signal of six different disorders from vocal disordered patients. The GCI locations are manually annotated for disorder analysis and supervised learning. We have proposed convolutional neural network based GCI detection method by fusing deep acoustic speech and linear prediction residual features for robust GCI detection. The experimental results showed that the proposed method is significantly better than the state-of-the-art GCI detection methods.

研究动机与目标

  • 为解决病理性语音中缺乏鲁棒的GCI检测方法的问题,这些方法通常依赖侵入性的EGG信号。
  • 开发一种数据驱动的端到端深度学习方法,避免手动参数调优和手工设计的启发式规则。
  • 实现在智能手机或低成本设备录制的标准语音信号上直接进行GCI检测。
  • 创建一个包含同步EGG与语音记录的新病理性语音数据集,用于研究验证。
  • 在声门激励微弱或模糊(由声带病变引起)的情况下,提升检测的准确性和鲁棒性。

提出的方法

  • 采用多通道3D-CNN架构,每个通道处理不同的输入表示:低通滤波语音(LPF_S)、低通滤波LPR(LPF_LPR),以及两者的正向截断版本。
  • 每个CNN模块由五个卷积层组成,包含批量归一化,省略最大池化操作以保留GCI区域的精细时间变化。
  • 最后一层使用Sigmoid激活函数,输出每帧的后验概率,用于GCI分类。
  • 通过最大似然组合预测概率实现晚期融合,联合结合声学(LPF_S)和残差(PC_LPF_LPR)分支的特征。
  • 最终的GCI被识别为被分类为GCI的帧内负峰值最大值的位置(概率≥0.1)。
  • 模型使用二元交叉熵损失函数,采用ADAM优化器,并在30个周期内使用He正态初始化权重进行训练。

实验结果

研究问题

  • RQ1在原始声学与LPR特征上训练的深度学习模型,能否比传统基于信号处理的方法更准确地检测病理性语音中的GCI?
  • RQ2融合声学与残差特征是否能提升在多种声带障碍下的GCI检测鲁棒性?
  • RQ3与现有最先进GCI检测技术(SEDREAMS、DYPSA、ZFF)相比,所提方法在识别率、漏检率和定时精度方面表现如何?
  • RQ4单一深度学习模型是否能无需针对特定声带障碍类型进行调优,即在多种声带障碍类型中实现泛化?
  • RQ5对语音和LPR信号进行正向截断与低通滤波,在病理性情况下在多大程度上提升了GCI检测性能?

主要发现

  • 所提方法实现了89.30%的识别率(IDR),显著高于SEDREAMS(84.98%)、DYPSA(79.33%)和ZFF(80.88%)。
  • 漏检率(MR)为5.97%,低于SEDREAMS(9.06%)、DYPSA(13.42%)和ZFF(10.64%),表明更少的GCI事件被遗漏。
  • 误报率(FAR)为4.70%,低于SEDREAMS(6.01%)、DYPSA(7.25%)和ZFF(8.48%),表明特异性更高。
  • 识别精度(IDA)为0.54ms,所有方法中最低,表明在GCI定位上具有更高的时间精度。
  • 模型1(LPF_S)实现了最高的单个F1得分(86.82%),而模型4(PC_LPF_LPR)通过抑制次级激励,最小化了误报。
  • 通过最大似然组合融合LPF_S与PC_LPF_LPR特征,实现了最佳整体性能,证实了声学与残差表示的互补优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。