Skip to main content
QUICK REVIEW

[论文解读] MOGAM: A Multimodal Object-oriented Graph Attention Model for Depression Detection

Junyeop Cha, Seoyun Kim|arXiv (Cornell University)|Mar 21, 2024
Mental Health via Writing被引用 4
一句话总结

本文提出MOGAM,一种多模态面向对象的图注意力模型,通过整合YouTube视频博客中的视觉对象、元数据和图结构化关系,实现对抑郁及高风险抑郁的检测。通过利用跨注意力机制融合多模态特征并构建对象共现图,MOGAM在临床确诊数据集上实现了87.1%的准确率和88.8%的F1分数,表现出优异的性能与可扩展性。

ABSTRACT

Early detection plays a crucial role in the treatment of depression. Therefore, numerous studies have focused on social media platforms, where individuals express their emotions, aiming to achieve early detection of depression. However, the majority of existing approaches often rely on specific features, leading to limited scalability across different types of social media datasets, such as text, images, or videos. To overcome this limitation, we introduce a Multimodal Object-Oriented Graph Attention Model (MOGAM), which can be applied to diverse types of data, offering a more scalable and versatile solution. Furthermore, to ensure that our model can capture authentic symptoms of depression, we only include vlogs from users with a clinical diagnosis. To leverage the diverse features of vlogs, we adopt a multimodal approach and collect additional metadata such as the title, description, and duration of the vlogs. To effectively aggregate these multimodal features, we employed a cross-attention mechanism. MOGAM achieved an accuracy of 0.871 and an F1-score of 0.888. Moreover, to validate the scalability of MOGAM, we evaluated its performance with a benchmark dataset and achieved comparable results with prior studies (0.61 F1-score). In conclusion, we believe that the proposed model, MOGAM, is an effective solution for detecting depression in social media, offering potential benefits in the early detection and treatment of this mental health condition.

研究动机与目标

  • 开发一种可扩展的多模态框架,用于检测社交媒体视频博客中的抑郁症状,特别是基于YouTube平台的内容,利用多种数据类型。
  • 通过引入视频博客内容的面向对象图表示,克服以往模型依赖特定特征(如面部表情)的局限性。
  • 通过整理来自经临床确诊抑郁或高风险潜力用户的视频博客数据集,确保模型的临床相关性。
  • 在基准数据集上评估模型的泛化能力,验证其在不同数据分布下的可扩展性。
  • 提供一种稳健且可解释的工具,用于基于真实世界用户生成的视频博客实现抑郁症状的早期检测。

提出的方法

  • 该模型通过使用YOLOv5检测每个视频博客中的视觉对象(如人物、杯子、床),并计算对象对之间的共现频率作为图边,构建对象共现图。
  • 从三个来源提取多模态特征:通过YOLOv5提取视觉对象特征,通过KoBERT提取元数据(标题、描述、时长)特征,通过ResNet提取帧的视觉特征。
  • 应用跨注意力机制,动态关注并融合来自三种模态(对象图、视觉特征、文本元数据)的表示。
  • 面向对象的图编码器使用图注意力网络(GATs)处理图结构,基于邻域关系学习上下文化的节点表示。
  • 最终的多模态表示输入分类器头,以预测抑郁或高风险抑郁状态。
  • 模型采用端到端训练,使用交叉熵损失,并通过标准指标(准确率、F1分数)进行评估。

实验结果

研究问题

  • RQ1多模态、面向对象的图注意力模型能否有效利用多种数据类型,在YouTube视频博客中检测抑郁?
  • RQ2与单模态或非图基方法相比,整合视觉对象、元数据和图结构化关系是否能提升检测性能?
  • RQ3该模型能否泛化到其他数据集,包括语言或数据分布不同的数据集?
  • RQ4特定对象或对象共现模式是否与视频博客中的抑郁或高风险状态显著相关?
  • RQ5使用经临床确诊的视频博客是否能增强模型的可靠性与临床相关性?

主要发现

  • MOGAM在来自经临床确诊抑郁或高风险潜力个体的主数据集上实现了87.1%的准确率和88.8%的F1分数。
  • 该模型表现出强大的可扩展性,在基准数据集上实现了0.61的F1分数,与先前的最先进方法相当。
  • 刀、叉、蛋糕、手提包和三明治等对象与抑郁状态存在显著关联,p值表明其具有强大的区分能力。
  • 与抑郁组和高风险潜力组相比,日常组中对象的出现频率更高,表明临床状态下对象使用模式发生改变。
  • p值最低的前五个对象(刀、叉、蛋糕、手提包、三明治)在各组中的平均出现次数存在显著差异,表明其具有潜在的诊断价值。
  • 事后分析确认,与食物相关的对象在抑郁组和高风险组中更为普遍,表明其在症状表达中的相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。