Skip to main content
QUICK REVIEW

[论文解读] Alzheimers Dementia Detection using Acoustic & Linguistic features and Pre-Trained BERT.

Akshay Valsaraj, Ithihas Madala|arXiv (Cornell University)|Sep 22, 2021
Speech Recognition and Synthesis参考文献 19被引用 6
一句话总结

本研究提出三种基于语音数据的阿尔茨海默病痴呆检测模型:一种基于eGeMAPs声学特征,另一种基于自动语音识别(ASR)转录文本的自定义语言特征,第三种则结合微调后的BERT与转录文本的TF-IDF。BERT+TF-IDF模型在测试集中达到76.06%的最高准确率,优于声学与语言模型,证明了预训练语言模型在从自发语音中进行早期AD检测方面的有效性。

ABSTRACT

Alzheimers disease is a fatal progressive brain disorder that worsens with time. It is high time we have inexpensive and quick clinical diagnostic techniques for early detection and care. In previous studies, various Machine Learning techniques and Pre-trained Deep Learning models have been used in conjunction with the extraction of various acoustic and linguistic features. Our study focuses on three models for the classification task in the ADReSS (The Alzheimers Dementia Recognition through Spontaneous Speech) 2021 Challenge. We use the well-balanced dataset provided by the ADReSS Challenge for training and validating our models. Model 1 uses various acoustic features from the eGeMAPs feature-set, Model 2 uses various linguistic features that we generated from auto-generated transcripts and Model 3 uses the auto-generated transcripts directly to extract features using a Pre-trained BERT and TF-IDF. These models are described in detail in the models section.

研究动机与目标

  • 开发低成本、非侵入性的诊断工具,用于通过自发语音实现阿尔茨海默病痴呆的早期检测。
  • 评估声学特征、语言特征与深度上下文NLP特征在区分AD患者与对照组中的有效性。
  • 在ADReSS 2021挑战赛数据集上,比较传统机器学习模型与基于预训练BERT的方法。
  • 探索视觉变换器(Vision Transformers)与sPCEN归一化频谱图在未来的声学建模中的潜力。

提出的方法

  • 从患者语音录音中提取eGeMAPs声学特征用于模型1。
  • 从自动生成的ASR转录文本中生成语言特征(包括Brunet指数、熵与类型-词形比)用于模型2。
  • 在转录语音上微调预训练BERT模型以获得上下文嵌入,并将其与TF-IDF特征拼接用于模型3。
  • 使用公式:tfidft,d = tft,d · log(N/dft) 将BERT嵌入与TF-IDF向量结合,其中tft,d为词频,dft为文档频率。
  • 在所有三个模型上使用5折交叉验证与测试集评估,训练并评估多种分类器(SVM、LR、RF)。
  • 提出未来工作:使用Vision Transformers(ViT)与sPCEN归一化频谱图,并对声学与基于BERT的模型进行集成建模。

实验结果

研究问题

  • RQ1预训练BERT模型能否有效捕捉自发语音转录文本中的阿尔茨海默病语言标志?
  • RQ2传统声学特征(eGeMAPs)与语言特征及深度上下文特征相比,在AD分类中的表现如何?
  • RQ3将BERT嵌入与TF-IDF结合是否能提升分类性能,优于单一特征集?
  • RQ4使用sPCEN归一化频谱图的视觉变换器能否在AD检测的声学建模中超越现有模型?

主要发现

  • 模型3(结合BERT嵌入与TF-IDF特征)在测试集中达到最高的76.06%准确率,显著优于模型1(59.5%)与模型2(57.75%)。
  • BERT+TF-IDF模型在测试集中获得0.7671的F1分数,表明精确率与召回率之间具有良好的平衡。
  • 在5折交叉验证中,模型3达到70.0%的准确率与0.717的F1分数,表明在各折中具有稳定的泛化能力。
  • 语言模型(模型2)表现出高精确率(0.867)但低召回率(0.464),表明其倾向于漏诊AD阳性病例。
  • 声学模型(模型1)性能最低,测试准确率仅为59.5%,特异性为52.2%,表明其在该数据集上判别能力有限。
  • 尽管理论潜力可观,但视觉变换器在频谱图上的实现未取得满意结果,因此建议未来从头开始训练,优化分块方式与sPCEN归一化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。