[论文解读] Exploring Multimodal Approaches for Alzheimer's Disease Detection Using Patient Speech Transcript and Audio Data
本研究提出了一种多模态框架,用于通过患者语音转录文本和音频进行阿尔茨海默病(AD)检测,利用 BERT、图神经网络(GNN)和 WavLM 进行特征提取。该方法引入了一种类似 CLIPPO 的对比学习方法,将文本到语音(TTS)音频与原始音频对齐,在 DementiaBank Pitt 数据集上实现了 84.84% 的最高准确率,优于单模态和标准多模态融合方法。
Alzheimer's disease (AD) is a common form of dementia that severely impacts patient health. As AD impairs the patient's language understanding and expression ability, the speech of AD patients can serve as an indicator of this disease. This study investigates various methods for detecting AD using patients' speech and transcripts data from the DementiaBank Pitt database. The proposed approach involves pre-trained language models and Graph Neural Network (GNN) that constructs a graph from the speech transcript, and extracts features using GNN for AD detection. Data augmentation techniques, including synonym replacement, GPT-based augmenter, and so on, were used to address the small dataset size. Audio data was also introduced, and WavLM model was used to extract audio features. These features were then fused with text features using various methods. Finally, a contrastive learning approach was attempted by converting speech transcripts back to audio and using it for contrastive learning with the original audio. We conducted intensive experiments and analysis on the above methods. Our findings shed light on the challenges and potential solutions in AD detection using speech and audio data.
研究动机与目标
- 开发一种低成本、非侵入性的早期阿尔茨海默病(AD)检测诊断方法,利用患者语音和转录文本。
- 通过有效的数据增强技术,解决 AD 研究中数据集规模较小的挑战。
- 探索文本与音频特征的多模态融合,以提升 AD 分类性能。
- 探究使用 TTS 生成音频进行对比学习是否能增强模型对 AD 患者语音模式的理解。
- 为未来基于多样化患者数据的多模态 AD 检测系统提供基础。
提出的方法
- 开发了一种基于 GNN 的方法(AD-GNN),利用 BERT 嵌入和图卷积网络从转录语音中提取结构化语言特征。
- 应用了包括同义词替换、句子删除和基于 GPT-3.5 的生成在内的数据增强技术,以增加训练数据的多样性并缓解类别不平衡问题。
- 使用 WavLM 模型提取音频特征,该模型是一种自监督预训练语音表征模型。
- 通过直接拼接、交叉网络注意力以及一种类似 CLIPPO 的对比学习框架实现多模态融合,该框架将原始音频与 TTS 生成的音频对齐。
- 类似 CLIPPO 的方法实现了原始语音与合成语音之间的联合嵌入学习,提升了语义对齐性,且无需依赖预训练语言模型。
- 在 DementiaBank Pitt 数据集上进行了大量实验,比较了单模态(文本、音频)和不同融合策略的多模态方法。

实验结果
研究问题
- RQ1与标准 NLP 模型相比,从转录语音中提取的图结构化语言特征是否能提升 AD 检测的准确率?
- RQ2各种数据增强技术在小规模 AD 数据集上提升模型泛化能力方面的有效性如何?
- RQ3文本与音频特征的多模态融合是否能显著提升 AD 检测性能?
- RQ4在原始音频与 TTS 生成音频之间进行对比学习是否能改善 AD 检测的表征学习?
- RQ5多模态融合带来的性能提升主要源于更强的模态(文本),还是音频也做出了有意义的贡献?
主要发现
- 仅使用文本的模型达到了 84.60% 的最高准确率,显著优于仅使用音频的模型(77.14%),表明语言特征对 AD 检测更具判别性。
- 类似 CLIPPO 的对比学习方法实现了最佳总体准确率 84.84%,表明将 TTS 音频与原始音频对齐可提升模型性能,且无需依赖预训练语言模型。
- 通过直接拼接(84.75%)和交叉网络注意力(84.18%)进行多模态融合的结果几乎与仅使用文本的基线模型相当,表明模型过度依赖于更强的文本模态。
- 数据增强方法(包括基于 GPT-3.5 和 RoBERTa 的增强器)改善有限,可能由于语义保留较差以及 AD 患者说话风格不匹配。
- WavLM 模型在音频上的表现欠佳,可能是因为缺乏在 AD 患者语音上的预训练,凸显了领域特定音频表征学习的必要性。
- 本研究证实,尽管音频数据包含有用信息,但其高维性和背景噪声限制了性能,有效的融合需要精心设计的架构。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。