[论文解读] The Verbal and Non Verbal Signals of Depression -- Combining Acoustics, Text and Visuals for Estimating Depression Level
本文提出一种基于注意力机制的深度神经网络,通过融合语音、文本和视觉模态,利用PHQ-8量表估计抑郁严重程度。通过整合七种模态特异性特征并利用注意力机制,该模型在DAIC-WOZ数据集上实现了最先进性能,相较于先前方法,RMSE降低7.17%,MAE降低8.08%。
Depression is a serious medical condition that is suffered by a large number of people around the world. It significantly affects the way one feels, causing a persistent lowering of mood. In this paper, we propose a novel attention-based deep neural network which facilitates the fusion of various modalities. We use this network to regress the depression level. Acoustic, text and visual modalities have been used to train our proposed network. Various experiments have been carried out on the benchmark dataset, namely, Distress Analysis Interview Corpus - a Wizard of Oz (DAIC-WOZ). From the results, we empirically justify that the fusion of all three modalities helps in giving the most accurate estimation of depression level. Our proposed approach outperforms the state-of-the-art by 7.17% on root mean squared error (RMSE) and 8.08% on mean absolute error (MAE).
研究动机与目标
- 开发一种多模态深度学习框架,通过融合多样化的行为信号提升抑郁程度估计的准确性。
- 探究言语(文本)、副语言(语音)和非言语(视觉)线索在抑郁严重程度预测中的相对贡献。
- 验证注意力机制在融合过程中动态加权各模态的有效性,以提升回归性能。
- 在基准DAIC-WOZ数据集上超越现有最先进方法,实现抑郁程度估计的性能突破。
提出的方法
- 该模型采用多模态注意力融合网络(CombAtt),处理七种不同的模态流:两种语音模态(韵律和频谱)、一种文本模态(转录嵌入)以及四种视觉模态(头部姿态、视线、微笑、自触碰)。
- 每种模态通过专用的深度神经网络独立编码,随后进行拼接并经由注意力机制加权,生成融合表征。
- 融合表征通过两层全连接层(使用ReLU激活函数)和Dropout(正则化率分别为0.25和0.2)进行正则化处理。
- 最后一层执行回归任务,预测PHQ-8评分(0–24),采用均方误差损失函数进行端到端训练。
- 注意力机制在推理过程中学习各模态的动态重要性权重,实现基于输入内容的自适应融合。
- 实验对比了多种融合配置,包括无注意力机制或缺少特定模态的消融实验,以分离各模态的贡献。
实验结果
研究问题
- RQ1与仅使用单一模态或部分模态组合相比,融合语音、文本和视觉模态是否能带来更优的抑郁严重程度估计?
- RQ2相较于固定加权或无融合策略,注意力机制在多模态抑郁程度估计中如何提升性能?
- RQ3在文本、语音和视觉模态中,哪一种对PHQ-8评分预测的贡献最为显著?
- RQ4所提出的模型在DAIC-WOZ基准数据集上相较于现有最先进方法的性能提升程度如何?
主要发现
- 三种模态(语音、文本和视觉)的完全融合取得最佳性能,RMSE为4.14,MAE为3.07,显著优于所有其他组合配置。
- 仅使用文本模态时对预测准确性的贡献最大,ME TR模型实现最低RMSE(4.80)和MAE(3.74),与临床直觉一致。
- 所提出的CombAtt模型相较于先前最先进方法(VFSC语义)将RMSE降低7.17%,MAE降低8.08%,且差异具有统计显著性。
- 注意力机制通过实现模态的动态加权提升了性能,表现为CombAtt在性能上优于无注意力变体(RMSE:4.69 vs. 4.14)。
- 该模型性能显著优于仅预测均值的基线模型(RMSE=5.73,MAE=4.74),证明其具备有意义的回归能力。
- 在所有配置中,CombAtt实现完全模态融合的模型获得最高解释方差分数(EVS=0.62),表明其具备强大的预测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。