Skip to main content
QUICK REVIEW

[论文解读] Assessment of Parkinson's Disease Medication State through Automatic Speech Analysis

Anna Pompili, Rubén Solera-Ureña|arXiv (Cornell University)|May 29, 2020
Voice and Speech Disorders被引用 4
一句话总结

本研究提出一种基于深度学习的说话人特定系统,通过自动语音分析对帕金森病患者的药物治疗状态(ON/OFF)进行分类。该系统利用语音记录中的声学-语音特征(尤其是eGeMAPS和MFCC),在半自发性叙事任务中实现了95.27%的准确率,展现出在远程、日常监测帕金森病患者药物状态方面的巨大潜力。

ABSTRACT

Parkinson's disease (PD) is a progressive degenerative disorder of the central nervous system characterized by motor and non-motor symptoms. As the disease progresses, patients alternate periods in which motor symptoms are mitigated due to medication intake (ON state) and periods with motor complications (OFF state). The time that patients spend in the OFF condition is currently the main parameter employed to assess pharmacological interventions and to evaluate the efficacy of different active principles. In this work, we present a system that combines automatic speech processing and deep learning techniques to classify the medication state of PD patients by leveraging personal speech-based bio-markers. We devise a speaker-dependent approach and investigate the relevance of different acoustic-prosodic feature sets. Results show an accuracy of 90.54% in a test task with mixed speech and an accuracy of 95.27% in a semi-spontaneous speech task. Overall, the experimental assessment shows the potentials of this approach towards the development of reliable, remote daily monitoring and scheduling of medication intake of PD patients.

研究动机与目标

  • 探究基于语音的生物标志物是否能够可靠地区分帕金森病患者在药物ON与OFF状态之间的差异。
  • 开发一种基于自动语音处理与深度学习的说话人特定系统,用于帕金森病患者的远程监测。
  • 评估不同语音任务(如朗读、叙事)对药物状态分类准确率的影响。
  • 评估各类声学-语音特征集(MFCC、delta-MFCC、eGeMAPS)在分类药物状态中的相关性。
  • 探索利用有限患者语音数据训练高精度个性化模型以实现临床监测的可行性。

提出的方法

  • 使用每位患者的个人语音数据训练说话人特定的深度神经网络(DNN)模型,以分类药物状态。
  • 提取多种声学-语音特征集:MFCC、delta-MFCC和eGeMAPS,分别反映语音的频谱特性、动态变化及语调特征。
  • 应用主成分分析(PCA)以降低特征维度,同时保留原始特征空间中95%的方差。
  • 在三项语音任务上评估系统:/a/音的发音、朗读简短文本,以及引导式半自发性叙事。
  • 通过不同特征集和语音任务在逐句级别测量模型性能。
  • 采用FraLusoPark语料库,其中包含74名葡萄牙语帕金森病患者在药物初治与用药状态下的录音。

实验结果

研究问题

  • RQ1能否利用个人语音生物标志物,通过自动语音分析可靠地区分帕金森病患者的药物ON与OFF状态?
  • RQ2语音任务的选择(如朗读与叙事)如何影响药物状态分类的准确率?
  • RQ3哪种声学-语音特征集(MFCC、delta-MFCC、eGeMAPS)在药物状态检测中能获得最高分类准确率?
  • RQ4通过PCA进行降维在多大程度上影响模型性能与效率?
  • RQ5说话人特定模型是否能在有限患者语音数据下实现高准确率,从而支持实际的远程监测?

主要发现

  • 在混合语音任务中,系统对药物状态的分类准确率达到90.54%,展现出强劲的基线性能。
  • 在使用eGeMAPS特征的半自发性叙事任务中,准确率最高,达到95.27%,凸显自然语音在分类中的价值。
  • 基于MFCC的模型经PCA降维后,在各项任务中准确率在86.49%至94.59%之间,叙事任务表现最佳。
  • PCA将特征维度最高降低79.7%,但导致eGeMAPS和MFCC+delta系统的性能下降,表明压缩存在权衡。
  • 说话人特定模型在个体层面表现出高准确率(平均83.78%–95.27%),标准差在12.51%至14.67%之间,表明个体间性能稳定。
  • 结果证实,半自发性自然语音录音在检测药物状态变化方面显著优于控制性任务(如元音发音)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。