[论文解读] Multimodal Deep Learning for Mental Disorders Prediction from Audio Speech Samples
本文提出了一种多模态深度学习框架,通过融合临床言语访谈中的音频和文本嵌入,以预测抑郁症、双相情感障碍和精神分裂症等精神障碍。通过利用 BERT、XLNet、WaveNet 和 VGG 风格网络等预训练模型,并采用带有辅助情绪标注数据的迁移学习方法,该模型在精神分裂症预测中实现了 74.35% 的平均准确率和 0.751 的 AUC,表现出在数据不平衡情况下的优异性能。
Key features of mental illnesses are reflected in speech. Our research focuses on designing a multimodal deep learning structure that automatically extracts salient features from recorded speech samples for predicting various mental disorders including depression, bipolar, and schizophrenia. We adopt a variety of pre-trained models to extract embeddings from both audio and text segments. We use several state-of-the-art embedding techniques including BERT, FastText, and Doc2VecC for the text representation learning and WaveNet and VGG-ish models for audio encoding. We also leverage huge auxiliary emotion-labeled text and audio corpora to train emotion-specific embeddings and use transfer learning in order to address the problem of insufficient annotated multimodal data available. All these embeddings are then combined into a joint representation in a multimodal fusion layer and finally a recurrent neural network is used to predict the mental disorder. Our results show that mental disorders can be predicted with acceptable accuracy through multimodal analysis of clinical interviews.
研究动机与目标
- 开发一种基于临床言语访谈多模态分析的自动化精神障碍预测系统。
- 通过利用迁移学习和大规模辅助情绪标注语料库,解决标注多模态数据有限的挑战。
- 通过可学习的融合机制融合异构的音频和文本表示,提升诊断准确率。
- 通过随机过采样和稳健的模型训练方法,处理精神健康数据集中的类别不平衡问题。
- 通过最终预测层中的注意力机制识别显著的语音片段,提升模型可解释性。
提出的方法
- 使用预训练语言模型(BERT、XLNet、FastText、Doc2VecC)从语音转录文本中提取上下文相关的文本嵌入。
- 通过预训练的 WaveNet 和 VGG 启发的模型提取音频特征,以编码语调和频谱特性。
- 利用迁移学习从大规模辅助文本和音频语料中学习情绪特定嵌入,以提升表示质量。
- 通过加权特征拼接融合层将音频和文本嵌入组合为联合多模态表示。
- 使用带有注意力机制的 LSTM 处理由融合后的表示,生成最终的精神障碍预测结果。
- 采用按家庭ID感知的数据划分方式的五折交叉验证,确保测试集与训练集的独立性,同时通过随机过采样缓解类别不平衡问题。
实验结果
研究问题
- RQ1与单模态方法相比,临床访谈中音频和文本特征的多模态融合是否能提升精神障碍预测的准确性?
- RQ2在低资源精神健康应用中,使用辅助情绪标注数据的迁移学习在增强表示学习方面有多高效?
- RQ3RNN 中的注意力机制在预测过程中能多大程度上突出临床相关的语音片段?
- RQ4在高度不平衡的训练数据(如仅 13 个阳性样本的精神分裂症)下,所提出的模型对罕见精神障碍的泛化能力如何?
- RQ5与传统方法(如 BOW 和 tf-idf)相比,上下文嵌入(如 BERT、XLNet)在精神障碍分类中是否表现更优?
主要发现
- 所提出的多模态框架在抑郁症、双相情感障碍和精神分裂症上的平均分类准确率达到 74.35%。
- 该模型在精神分裂症上的 AUC 达到 0.751,尽管该类别样本极少(仅 13 例阳性),表明其对数据不平衡具有极强的鲁棒性。
- 使用上下文嵌入(如 BERT、XLNet)显著优于传统方法(如 BOW 和 tf-idf),准确率最高提升达 15 个百分点。
- LSTM 层中的注意力机制能够识别并优先关注与焦虑和沟通问题相关的语音片段,从而增强模型的可解释性。
- 在所有精神障碍类别中,多模态系统始终优于单模态基线模型(仅音频或仅文本)。
- ROC 曲线分析表明,多模态模型在区分性能方面表现更优,尤其在抑郁症和双相情感障碍中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。