Skip to main content
QUICK REVIEW

[论文解读] Multi-Modal Detection of Alzheimer's Disease from Speech and Text

Amish Mittal, Sourav Sahoo|arXiv (Cornell University)|Nov 30, 2020
Voice and Speech Disorders参考文献 49被引用 9
一句话总结

该论文提出了一种多模态深度学习框架,通过迁移学习融合语音和文本转录,利用Dementiabank Pitt语料库对阿尔茨海默病(AD)进行检测,准确率达到85.3%。该方法采用卷积神经网络(CNN)提取音频嵌入,使用BERT-CNN融合模型处理文本,通过早期融合与晚期融合结合预测结果,并在使用自动语音识别(ASR)生成的转录文本时仍表现出鲁棒性,准确率达到78.8%。

ABSTRACT

Reliable detection of the prodromal stages of Alzheimer's disease (AD) remains difficult even today because, unlike other neurocognitive impairments, there is no definitive diagnosis of AD in vivo. In this context, existing research has shown that patients often develop language impairment even in mild AD conditions. We propose a multimodal deep learning method that utilizes speech and the corresponding transcript simultaneously to detect AD. For audio signals, the proposed audio-based network, a convolutional neural network (CNN) based model, predicts the diagnosis for multiple speech segments, which are combined for the final prediction. Similarly, we use contextual embedding extracted from BERT concatenated with a CNN-generated embedding for classifying the transcript. The individual predictions of the two models are then combined to make the final classification. We also perform experiments to analyze the model performance when Automated Speech Recognition (ASR) system generated transcripts are used instead of manual transcription in the text-based model. The proposed method achieves 85.3% 10-fold cross-validation accuracy when trained and evaluated on the Dementiabank Pitt corpus.

研究动机与目标

  • 开发一种端到端的多模态深度学习系统,利用语音和文本转录实现阿尔茨海默病的早期检测。
  • 评估迁移学习在克服阿尔茨海默病分类数据稀缺问题中的有效性。
  • 评估使用ASR生成的转录文本替代人工转录文本在实际部署中的可行性。
  • 研究模型在年龄和性别方面是否存在人口统计学偏差。
  • 比较多种多模态融合策略,识别最优的音频与文本特征组合以实现阿尔茨海默病检测。

提出的方法

  • 基于CNN的音频网络处理多个语音片段,提取声学嵌入以用于诊断预测。
  • 使用BERT嵌入结合CNN生成的嵌入提取文本特征,实现对上下文和句法结构的分析。
  • 通过晚期融合将音频和文本分支的独立预测结果结合,生成最终分类结果。
  • 在音频和文本模型中应用迁移学习,以缓解数据稀缺问题,利用预训练表征。
  • 在Dementiabank Pitt语料库上通过10折交叉验证评估系统,使用人工转录和ASR生成的转录文本。
  • 针对年龄组(86–95岁)和性别进行偏差分析,评估特异性、敏感性和准确率的差异。

实验结果

研究问题

  • RQ1与单模态方法相比,结合语音和文本的多模态深度学习模型是否能提升阿尔茨海默病检测的准确率?
  • RQ2迁移学习在有限的阿尔茨海默病数据集上提升模型性能方面有多有效?
  • RQ3ASR生成的转录文本在多大程度上可以替代人工转录文本,而不会导致性能显著下降?
  • RQ4该模型在阿尔茨海默病分类中是否对特定年龄组或性别表现出偏差?
  • RQ5在多模态阿尔茨海默病检测中,结合音频与文本特征的最佳融合策略是什么?

主要发现

  • 当在Dementiabank Pitt语料库的人工转录文本上进行训练和测试时,所提出的多模态模型达到85.3%的准确率和84.4%的F1分数。
  • 当使用ASR生成的转录文本时,模型达到78.8%的准确率和78.2%的F1分数,表明即使存在转录错误,仍具有实际可行性。
  • 在86–95岁年龄组中,准确率较低(70.0%),原因包括样本量小以及与AD无关的重叠性言语障碍。
  • 未观察到显著的性别偏差,尽管男性检测准确率较低,这归因于男性参与人数较少以及女性群体中AD基线发病率更高。
  • 在所有设置中,联合模型的表现优于单独的音频和文本模型,除非在使用短时音频片段和人工转录文本时。
  • 在包含填充词和语义不连贯等语言标志的语音片段中,即使ASR引入错误,模型也能以高置信度(超过0.8)预测为AD阳性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。