Skip to main content
QUICK REVIEW

[论文解读] Identification of Dementia Using Audio Biomarkers

Rupayan Chakraborty, Meghna Pandharipande|arXiv (Cornell University)|Feb 27, 2020
Music and Audio Processing参考文献 23被引用 8
一句话总结

本文提出一种与语言无关的、基于音频生物标志物的方法,仅利用临床医生与患者对话中的非语言声学特征,对痴呆阶段(健康对照组(HC)、轻度认知障碍(MCI)和阿尔茨海默病(AD))进行分类。通过采用多种声学特征类型(频谱、时域、倒谱)的得分级融合及数据平衡,该方法实现了82%的准确率,相较于特征级融合提高了5个百分点的绝对准确率,即使在具有挑战性的MCI分类任务中也表现出稳健性能。

ABSTRACT

Dementia is a syndrome, generally of a chronic nature characterized by a deterioration in cognitive function, especially in the geriatric population and is severe enough to impact their daily activities. Early diagnosis of dementia is essential to provide timely treatment to alleviate the effects and sometimes to slow the progression of dementia. Speech has been known to provide an indication of a person's cognitive state. The objective of this work is to use speech processing and machine learning techniques to automatically identify the stage of dementia such as mild cognitive impairment (MCI) or Alzheimers disease (AD). Non-linguistic acoustic parameters are used for this purpose, making this a language independent approach. We analyze the patients audio excerpts from a clinician-participant conversations taken from the Pitt corpus of DementiaBank database, to identify the speech parameters that best distinguish between MCI, AD and healthy (HC) speech. We analyze the contribution of various types of acoustic features such as spectral, temporal, cepstral their feature-level fusion and selection towards the identification of dementia stage. Additionally, we compare the performance of using feature-level fusion and score-level fusion. An accuracy of 82% is achieved using score-level fusion with an absolute improvement of 5% over feature-level fusion.

研究动机与目标

  • 开发一种非侵入性、与语言无关的方法,仅利用语音中的声学特征对痴呆阶段进行分类。
  • 识别最具有区分性的音频生物标志物(频谱、时域、倒谱),以区分HC、MCI和AD。
  • 比较早期融合(特征级)与晚期融合(得分级)策略,以提升分类性能。
  • 解决痴呆数据集中类别不平衡问题,特别是针对MCI类别,以提高模型的鲁棒性和准确率。
  • 仅使用语音声学特征,实现多类别痴呆阶段分类的高准确率,避免依赖语言内容或转录文本。

提出的方法

  • 从Pitt DementiaBank语料库中的音频片段中提取非语言声学特征——频谱、时域、倒谱及其组合。
  • 通过在分类前拼接多种声学特征类型,实现特征级融合,形成单一特征向量。
  • 通过结合基于独立特征集训练的多个分类器的后验概率,实现得分级融合,采用两种方法:(1) 后验概率之和的最大值;(2) 加权后验概率平均值的最大值。
  • 在早期融合和晚期融合配置中使用多种分类器(如SMO、MLP、BayesNet、SimpleLogistic)评估性能。
  • 通过重采样技术对HC、MCI和AD三类数据集进行平衡,以缓解类别不平衡问题并提升MCI分类性能。
  • 使用精确率、召回率和F1分数评估所有三类的性能,整体准确率为首要指标。

实验结果

研究问题

  • RQ1哪些声学特征类型(频谱、时域、倒谱)在区分HC、MCI和AD的语音中最为有效?
  • RQ2多组声学特征集的得分级融合是否优于特征级融合,以实现痴呆阶段的分类?
  • RQ3类别不平衡(特别是MCI类别)如何影响分类性能?数据平衡能否改善结果?
  • RQ4能否通过与语言无关的、非语言的方法,仅利用语音声学特征实现多类别痴呆阶段分类的高准确率?
  • RQ5何种声学生物标志物组合与融合策略的组合能最大化痴呆分期分类的准确率?

主要发现

  • 得分级融合结合数据平衡后,整体准确率达到82%,相较于特征级融合提升了5个百分点的绝对准确率。
  • 表现最佳的配置为在平衡数据上使用SMO分类器进行得分级融合,整体F1分数达到82%。
  • MCI分类仍是最具挑战性的类别,即使在数据平衡后,大多数配置的F1分数仍低于60%。
  • 特征级融合将分类准确率从基线的66%(基线)提升至77%的F1分数,证明了结合多样化声学特征的价值。
  • 数据平衡显著提升了所有分类器的性能,尤其在MCI类别上,表明类别不平衡是初始结果中主要的干扰因素。
  • 所提出的方法仅使用声学生物标志物即实现了82%的高准确率,证明其在与语言无关、非侵入性痴呆分期中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。