Skip to main content
QUICK REVIEW

[论文解读] Predicting Depression Severity by Multi-Modal Feature Engineering and Fusion

Aven Samareh, Yan Jin|arXiv (Cornell University)|Nov 29, 2017
Emotion and Mood Recognition参考文献 3被引用 5
一句话总结

本文提出了一种多模态融合模型,整合了音频、视觉和文本特征,以比单模态模型更准确地预测 PHQ-8 抑郁严重程度评分。通过使用基于置信度的决策级融合——即选择置信度最高的模态的预测结果——该模型在测试集上实现了 4.68 的 RMSE 和 4.31 的 MAE,优于 AVEC2017 基线模型和单模态方法。

ABSTRACT

We present our preliminary work to determine if patient's vocal acoustic, linguistic, and facial patterns could predict clinical ratings of depression severity, namely Patient Health Questionnaire depression scale (PHQ-8). We proposed a multi modal fusion model that combines three different modalities: audio, video , and text features. By training over AVEC 2017 data set, our proposed model outperforms each single modality prediction model, and surpasses the data set baseline with ice margin.

研究动机与目标

  • 探究语音声学、语言和面部特征是否能够客观预测临床抑郁严重程度。
  • 为 AVEC2017 数据集中的音频、视频和文本数据开发一个多模态特征工程流程。
  • 通过基于置信度的决策级融合策略,融合多种模态以提升预测性能。
  • 在 PHQ-8 评分上,评估模型相对于 AVEC2017 基线和单模态模型的性能表现。
  • 探讨各模态在抑郁严重程度预测中的相对信息量和主导性。

提出的方法

  • 使用基于 COVAREP 的描述符提取了 1,425 个音频特征,包括 F0、H1/H2、MCEP、HMPDM 以及一阶和二阶差分系数。
  • 从 68 个面部关键点中计算了 133 个视觉特征,包括成对欧几里得距离和角度,并按区域分组(左眼、右眼和口部)。
  • 使用 AFINN 情感分析提取了 8 个文本特征,包括情感得分的均值、中位数、最小值、最大值和标准差,以及与抑郁相关的词汇比例。
  • 对每种模态独立应用随机森林回归器以生成预测评分。
  • 实施基于置信度的融合策略,即选择在树预测中标准差最大(即置信度最高)的模态作为最终输出。
  • 采用“赢家通吃”融合规则,选择模态置信度最高的单一预测结果,以降低噪声并提高鲁棒性。

实验结果

研究问题

  • RQ1语音声学、语言和面部特征是否能共同比单模态模型更准确地预测 PHQ-8 抑郁严重程度?
  • RQ2基于置信度的决策级融合与简单平均或其他融合策略相比,在多模态抑郁预测中表现如何?
  • RQ3在预测中,哪种模态——音频、视觉或文本——通常占主导地位?这反映了模态的信息量如何?
  • RQ4基于情感的文本特征和抑郁相关词汇比例在多大程度上提升了预测性能?
  • RQ5将性别等人口统计学变量纳入模型,对模型的预测性能有何影响?

主要发现

  • 所提出的基于置信度的融合模型在测试集上实现了 4.68 的 RMSE 和 4.31 的 MAE,显著优于开发集上的 AVEC2017 基线模型(RMSE: 5.42,MAE: 5.29)。
  • 仅使用音频的模型在单模态中表现最佳,其在开发集上的 RMSE 为 5.45,MAE 为 4.52,表明其具有强大的预测能力。
  • 包含性别的融合模型在测试集中实现了最低的 RMSE(4.23)和 MAE(3.89),证明了引入人口统计学特征的益处。
  • 音频模态因置信度评分更高而始终在预测中占主导地位,表明其携带了更可靠且具有区分性的信息。
  • 引入 AFINN 情感特征显著提升了模型性能,凸显了基于效价的情感分析在抑郁严重程度预测中的价值。
  • 通过优化静音检测和倒频谱分析等特征,模型性能进一步提升,表明未来通过特征工程仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。