Skip to main content
QUICK REVIEW

[论文解读] Comparative Study of Speech Analysis Methods to Predict Parkinson's Disease

Adedolapo Aishat Toye, Suryaprakash Kompalli|arXiv (Cornell University)|Nov 14, 2021
Voice and Speech Disorders被引用 8
一句话总结

本研究利用声学特征(jitter、shimmer)和梅尔频率倒谱系数(MFCC)评估机器学习模型,以从语音信号中预测帕金森病(PD)。基于两个数据集——意大利帕金森语音与语音数据集及MDVR-KCL数据集,研究发现,结合声学特征与MFCC特征的SVM在意大利数据集上达到98.9%的准确率,在MDVR-KCL数据集上达到86.3%的准确率,优于先前方法,证明了特征融合在早期PD检测中的有效性。

ABSTRACT

One of the symptoms observed in the early stages of Parkinson's Disease (PD) is speech impairment. Speech disorders can be used to detect this disease before it degenerates. This work analyzes speech features and machine learning approaches to predict PD. Acoustic features such as shimmer and jitter variants, and Mel Frequency Cepstral Coefficients (MFCC) are extracted from speech signals. We use two datasets in this work: the MDVR-KCL and the Italian Parkinson's Voice and Speech database. To separate PD and non-PD speech signals, seven classification models were implemented: K-Nearest Neighbor, Decision Trees, Support Vector Machines, Naive Bayes, Logistic Regression, Gradient Boosting, Random Forests. Three feature sets were used for each of the models: (a) Acoustic features only, (b) All the acoustic features and MFCC, (c) Selected subset of features from acoustic features and MFCC. Using all the acoustic features and MFCC, together with SVM produced the highest performance with an accuracy of 98% and F1-Score of 99%. When compared with prior art, this shows a better performance. Our code and related documentation is available in a public domain repository.

研究动机与目标

  • 开发一种基于语音信号分析的早期帕金森病检测机器学习框架。
  • 比较多种分类器在从帕金森病患者与健康人群语音样本中提取的多样化语音特征上的预测性能。
  • 评估结合声学特征(jitter、shimmer)与MFCC对分类准确率的影响。
  • 发布一个公开代码库,以支持帕金森病筛查的可复现研究与临床应用。
  • 识别适用于低资源、半临床帕金森病诊断场景的最优特征集与模型。

提出的方法

  • 从MDVR-KCL和意大利帕金森语音与语音数据集的语音录音中提取11个声学特征(jitter、shimmer变体、HNR)和13个MFCC。
  • 应用三种特征选择策略:(a) 仅声学特征,(b) 所有声学与MFCC特征,(c) 从组合特征集中选取的10个特征子集。
  • 训练七种分类器:K近邻、决策树、支持向量机、朴素贝叶斯、逻辑回归、梯度提升与随机森林。
  • 使用5折交叉验证和标准指标(准确率、精确率、召回率、F1-score与特异性)评估模型性能。
  • 采用简单的基于静音的分割方法从长音频文件中提取语音段,承认不同说话人之间可能存在变异性。
  • 在GitHub上发布公开代码库,包含代码、模型与文档,以支持可复现性与临床部署。

实验结果

研究问题

  • RQ1声学特征(jitter、shimmer)与谱特征(MFCC)的何种组合能从语音信号中实现帕金森病预测的最高准确率?
  • RQ2当应用于帕金森病语音分类时,不同机器学习模型(SVM、随机森林、梯度提升等)的性能如何比较?
  • RQ3特征选择是否能提升模型性能?如果是,哪组特征最为有效?
  • RQ4在样本量与录音条件不同的数据集(意大利帕金森语音与语音 vs. MDVR-KCL)中,模型性能如何变化?
  • RQ5能否开发一个公开可用、可复现的框架,以支持使用语音数据进行早期、非侵入性帕金森病筛查?

主要发现

  • 在意大利帕金森语音与语音数据集上,使用全部24个特征(11个声学特征 + 13个MFCC)的SVM达到最高准确率98.9%,F1-score为99.0%。
  • 在MDVR-KCL数据集上,使用全部24个特征的KNN达到最佳准确率(90.9%),而使用全部特征的SVM达到86.3%的准确率,优于该数据集上的先前方法。
  • 在两个数据集及所有模型中,声学特征与MFCC的组合始终优于单独使用任一特征集。
  • 特征选择虽降低了模型复杂度,但并未总是提升性能;例如,KNN与SVM在MDVR-KCL数据集上使用全部特征时表现更优。
  • 本研究表现最佳的模型(意大利数据集上的SVM)超越了先前研究成果,包括Chethan等人(2020)报告的99.2%准确率,但后者超参数不可复现。
  • 作者指出了当前分割方法的局限性,并指出不同说话人之间语音分割不一致可能影响性能,尤其是在较长音频文件上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。