Skip to main content
QUICK REVIEW

[论文解读] Alzheimer's Dementia Recognition Using Acoustic, Lexical, Disfluency and Speech Pause Features Robust to Noisy Inputs

Morteza Rohanian, Julian Hough|arXiv (Cornell University)|Jun 29, 2021
Speech Recognition and Synthesis被引用 10
一句话总结

本文提出了一种多模态深度学习方法,融合自动语音识别(ASR)转录的语音、声学特征、不流畅标记、停顿信息以及词概率,以检测阿尔茨海默病痴呆并预测MMSE评分。其最佳BiLSTM模型结合高速公路层,在MMSE回归任务上实现了84%的准确率和4.26的RMSE,表明通过门控机制进行多模态融合能显著提升对噪声输入的鲁棒性,并优于单模态模型的诊断性能。

ABSTRACT

We present two multimodal fusion-based deep learning models that consume ASR transcribed speech and acoustic data simultaneously to classify whether a speaker in a structured diagnostic task has Alzheimer's Disease and to what degree, evaluating the ADReSSo challenge 2021 data. Our best model, a BiLSTM with highway layers using words, word probabilities, disfluency features, pause information, and a variety of acoustic features, achieves an accuracy of 84% and RSME error prediction of 4.26 on MMSE cognitive scores. While predicting cognitive decline is more challenging, our models show improvement using the multimodal approach and word probabilities, disfluency and pause information over word-only models. We show considerable gains for AD classification using multimodal fusion and gating, which can effectively deal with noisy inputs from acoustic features and ASR hypotheses.

研究动机与目标

  • 开发一种鲁棒的多模态深度学习系统,利用语音转录文本和声学特征进行阿尔茨海默病痴呆识别。
  • 评估从ASR输出中提取的不流畅性、停顿和词概率特征对认知功能下降检测的贡献。
  • 在ASR假设不完美等噪声输入条件下,提升阿尔茨海默病分类和MMSE回归任务的性能。
  • 研究与单模态模型相比,使用门控机制进行多模态融合是否能增强鲁棒性和预测准确性。
  • 评估仅使用结构化诊断访谈中的音频数据检测早期认知损伤和疾病进展的可行性。

提出的方法

  • 使用带有高速公路层的BiLSTM处理来自ASR输出和原始音频的词序列、词概率、不流畅标记、停顿特征以及声学特征(如语音速率、停顿比例、发声时间)的序列。
  • 采用可学习门控机制的多模态融合策略,动态加权文本模态与声学模态的贡献,以提升对噪声输入的鲁棒性。
  • 利用ASR系统输出的词概率作为词汇可预测性和语法完整性的代理指标,增强对语义和句法障碍的检测能力。
  • 从ASR转录文本中提取不流畅标记(如填充停顿和非填充停顿),以捕捉早期阿尔茨海默病中常见的言语迟疑现象。
  • 在ADReSSo 2021的两个任务上端到端训练模型:二分类AD识别和MMSE评分回归,并额外评估认知功能下降预测性能。
  • 使用BERT作为纯文本建模的基线模型,并在单模态与多模态设置之间进行比较,以评估融合带来的优势。

实验结果

研究问题

  • RQ1从ASR转录文本中提取的不流畅性和停顿特征能否提升阿尔茨海默病痴呆的分类和MMSE评分预测?
  • RQ2在ASR转录存在噪声的条件下,ASR输出中的词概率如何有助于检测认知功能下降?
  • RQ3在现实世界中的噪声输入场景下,使用门控机制的多模态融合是否优于单模态模型?
  • RQ4当与来自ASR输出的文本和语言特征结合时,声学特征在多大程度上提升了模型性能?
  • RQ5在结构化诊断访谈数据上训练的多模态模型,能否有效预测两年内的认知功能进展?

主要发现

  • 性能最佳的模型为结合词、词概率、不流畅性、停顿和声学特征的BiLSTM,其在阿尔茨海默病痴呆分类任务中达到84%的准确率。
  • 该模型在MMSE评分回归任务中实现了4.26的RMSE,优于所有其他配置,表现出优异的回归性能。
  • 采用门控机制的多模态融合显著提升了性能,与最佳单模态模型相比,RMSE降低了1.15分(4.26 vs. 5.31)。
  • 在交叉验证中,将词概率加入词汇特征后,测试准确率从0.76提升至0.77,RMSE从5.31降至4.78。
  • 在认知功能进展预测任务中,采用门控机制的多模态LSTM优于所有其他模型,测试F1得分为0.62,接近最佳基线模型(0.67)。
  • 尽管多模态融合具有优势,但基于BERT的模型在纯文本分类任务中表现优于LSTM(准确率0.80 vs. 0.81),表明BERT在该场景下可能更适用于纯文本建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。