[论文解读] Multi-modal deep learning system for depression and anxiety detection
本文提出了一种多模态深度学习系统,将手工设计的临床特征与自administered语音任务中学习到的深度音频和文本表征相结合,用于检测抑郁和焦虑。通过结合Wav2Vec 2.0进行语音处理、RoBERTa进行转录文本处理,并引入专家设计的特征,模型将抑郁的F1分数提升至0.63,焦虑的F1分数提升至0.57,分别高于仅使用手工特征时的0.58和0.54。
Traditional screening practices for anxiety and depression pose an impediment to monitoring and treating these conditions effectively. However, recent advances in NLP and speech modelling allow textual, acoustic, and hand-crafted language-based features to jointly form the basis of future mental health screening and condition detection. Speech is a rich and readily available source of insight into an individual's cognitive state and by leveraging different aspects of speech, we can develop new digital biomarkers for depression and anxiety. To this end, we propose a multi-modal system for the screening of depression and anxiety from self-administered speech tasks. The proposed model integrates deep-learned features from audio and text, as well as hand-crafted features that are informed by clinically-validated domain knowledge. We find that augmenting hand-crafted features with deep-learned features improves our overall classification F1 score comparing to a baseline of hand-crafted features alone from 0.58 to 0.63 for depression and from 0.54 to 0.57 for anxiety. The findings of our work suggest that speech-based biomarkers for depression and anxiety hold significant promise in the future of digital health.
研究动机与目标
- 开发一种可扩展、客观的数字筛查工具,用于通过自administered语音任务检测抑郁和焦虑。
- 解决传统筛查方法的局限性,包括患者参与度低、临床医生负担重以及缺乏标准化。
- 通过整合领域知识指导的手工特征与最先进的语音和文本深度表征,提升分类性能。
- 探究结合多种模态(声学、语言和临床)是否能超越单一特征集,在抑郁和焦虑检测中实现更优表现。
提出的方法
- 模型使用Wav2Vec 2.0从原始音频中提取深度表征,随后通过两层双向LSTM和两头多头注意力机制生成声学嵌入(R1)。
- 对于文本内容,将RoBERTa应用于语音转录文本,输出经由两层双向LSTM和两头多头注意力层处理,生成语言嵌入(R2)。
- 手工特征(R3)基于临床验证的指标(如语速、代词使用频率和语调模式)提取,由领域专家设计,作为第三种模态加入。
- 将三种表征(R1、R2、R3)拼接为统一嵌入,通过两层前馈网络(ReLU激活)处理,并使用二元交叉熵损失进行优化。
- 系统在自administered语音任务数据集上采用5折交叉验证进行训练与评估,包括提示性叙事和语义流畅性任务。
- 使用PHQ-8(抑郁)和GAD-7(焦虑)的得分阈值10进行二分类,其中25.3%的受试者被分类为抑郁阳性,12.8%为焦虑阳性。
实验结果
研究问题
- RQ1与仅使用手工特征相比,将语音和文本的深度表征与手工临床特征结合,是否能提升抑郁和焦虑检测的性能?
- RQ2引入深度表征特征后,对自administered语音中抑郁和焦虑的F1分数有何影响?
- RQ3数据不平衡(尤其是焦虑病例)在多大程度上影响模型性能与泛化能力?
- RQ4模型在抑郁或焦虑检测中表现更优?其性能差异的可能原因是什么?
主要发现
- 将深度表征与手工特征结合后,抑郁检测的F1分数从仅使用手工特征时的0.58提升至0.63。
- 在加入深度表征后,焦虑检测的F1分数从仅使用手工特征时的0.54提升至0.57。
- 模型在抑郁检测上的整体F1分数(0.63)高于焦虑检测(0.57),可能由于焦虑病例的数据不平衡更严重(阳性比例12.8% vs 抑郁的25.3%)。
- 模型在预测“诊断”类别时表现弱于“无诊断”类别,表明存在类别不平衡和长尾评分分布带来的挑战。
- 焦虑相关声学特征的严重程度变化较小,而抑郁相关特征则更明显,表明焦虑可能更难通过语音特征检测。
- 结合手工特征与深度表征可最大化从语音中提取信号,证明了将临床知识与现代表征学习相结合的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。