[论文解读] Predicting Mood Disorder Symptoms with Remotely Collected Videos Using an Interpretable Multimodal Dynamic Attention Fusion Network
本文提出了一种新颖的可解释性多模态动态注意力融合网络,利用远程收集的智能手机视频中的音频、视频和文本数据,预测抑郁、焦虑和快感缺失症状。通过卷积神经网络学习时序嵌入,并利用Transformer编码器进行融合,该模型在性能上优于静态嵌入方法,并通过SHAP可解释性分析识别出关键数字标志,仅使用25%的特征即实现了稳定表现。
We developed a novel, interpretable multimodal classification method to identify symptoms of mood disorders viz. depression, anxiety and anhedonia using audio, video and text collected from a smartphone application. We used CNN-based unimodal encoders to learn dynamic embeddings for each modality and then combined these through a transformer encoder. We applied these methods to a novel dataset - collected by a smartphone application - on 3002 participants across up to three recording sessions. Our method demonstrated better multimodal classification performance compared to existing methods that employed static embeddings. Lastly, we used SHapley Additive exPlanations (SHAP) to prioritize important features in our model that could serve as potential digital markers.
研究动机与目标
- 开发一种可扩展、可解释的方法,利用智能手机远程收集的多媒体数据检测情绪障碍症状。
- 通过建模音频、视频和文本中的时序动态而非静态表示,解决先前研究的局限性。
- 通过基于Transformer的架构提升多模态融合,以捕捉随时间变化的跨模态依赖关系。
- 利用SHapley加法解释(SHAP)识别临床相关的数字标志,以增强模型可解释性并进行验证。
- 在大规模、真实世界的数据集上评估该方法,该数据集为无临床监督下收集,确保对嘈杂、远程数据的鲁棒性。
提出的方法
- 该模型采用基于CNN的单模态编码器,以0.1秒的分辨率从音频、视频和文本中提取动态时序嵌入。
- 各模态的特征独立处理,以学习时间解析的表示,保留时序动态特性。
- Transformer编码器融合多模态的动态嵌入,实现对随时间变化的跨模态依赖关系的关注。
- 该框架使用SHapley加法解释(SHAP)对特征重要性进行排序,并识别每种症状预测中最具影响力的输入。
- 对远程智能手机数据应用了严格的质控流程,以过滤低质量录音和不真诚的回答。
- 该模型在一项新数据集上进行训练和评估,包含3,002名参与者,每人最多参与三次录音会话,症状标签使用PHQ-9、GAD-7和SHAPS。
实验结果
研究问题
- RQ1基于动态嵌入的多模态深度学习模型是否能在预测情绪障碍症状方面优于依赖静态嵌入的现有方法?
- RQ2如何通过SHAP增强多模态心理健康预测中的模型可解释性,以识别具有临床意义的数字标志?
- RQ3在仅接受低监督的远程智能手机数据训练下,模型在面对数据噪声和变异时,其性能能维持多高?
- RQ4哪些特定的音频、视频和文本特征最能预测抑郁、焦虑和快感缺失症状?
- RQ5是否可通过减少高影响力特征集来维持接近最优的模型性能,从而实现高效的数字标志发现?
主要发现
- 所提出的动态多模态融合模型在F1分数上优于依赖静态嵌入的先前最先进方法。
- 在仅使用SHAP识别出的前25%最重要特征时,模型性能保持稳定,PHQ-9的全特征集与最小特征集之间F1分数差异仅为1%。
- 每种症状量表的前10个SHAP排序特征均包含来自所有三种模态的代表性元素,表明多模态对预测的共同贡献。
- 跨障碍共享的特征包括文本极性、情感值以及与唇部运动相关的面部动作单元,提示存在共同的行为标志。
- 识别出障碍特异性特征,例如PHQ-9的积极情感文本特征(如唤醒度、支配度)和SHAPS的名词标签,凸显了不同的症状特征。
- 通过全面的质量控制流程,该方法在嘈杂的远程数据中表现出鲁棒性,实现了在真实世界智能手机数据上的可靠性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。