Skip to main content
QUICK REVIEW

[논문 리뷰] MOGAM: A Multimodal Object-oriented Graph Attention Model for Depression Detection

Junyeop Cha, Seoyun Kim|arXiv (Cornell University)|2024. 03. 21.
Mental Health via Writing인용 수 4
한 줄 요약

이 논문은 유튜브 뷰로그에서 시각적 객체, 메타데이터, 그래프 구조적 관계를 통합하여 우울증 및 고위험 우울증을 탐지하는 다중모달 객체 지향 그래프 어텐션 모델인 MOGAM을 제안한다. 교차 어텐션을 활용해 다중모달 특징을 융합하고 객체 공존 그래프를 구축함으로써 임상 진단 데이터셋에서 87.1%의 정확도와 88.8%의 F1 스코어를 달성하여 뛰어난 성능과 확장성을 입증한다.

ABSTRACT

Early detection plays a crucial role in the treatment of depression. Therefore, numerous studies have focused on social media platforms, where individuals express their emotions, aiming to achieve early detection of depression. However, the majority of existing approaches often rely on specific features, leading to limited scalability across different types of social media datasets, such as text, images, or videos. To overcome this limitation, we introduce a Multimodal Object-Oriented Graph Attention Model (MOGAM), which can be applied to diverse types of data, offering a more scalable and versatile solution. Furthermore, to ensure that our model can capture authentic symptoms of depression, we only include vlogs from users with a clinical diagnosis. To leverage the diverse features of vlogs, we adopt a multimodal approach and collect additional metadata such as the title, description, and duration of the vlogs. To effectively aggregate these multimodal features, we employed a cross-attention mechanism. MOGAM achieved an accuracy of 0.871 and an F1-score of 0.888. Moreover, to validate the scalability of MOGAM, we evaluated its performance with a benchmark dataset and achieved comparable results with prior studies (0.61 F1-score). In conclusion, we believe that the proposed model, MOGAM, is an effective solution for detecting depression in social media, offering potential benefits in the early detection and treatment of this mental health condition.

연구 동기 및 목표

  • 다양한 데이터 유형을 활용하여 유튜브를 포함한 소셜 미디어 뷰로그에서의 우울증 탐지를 위한 확장 가능한 다중모달 프레임워크를 개발하는 것.
  • 이전 모델이 특정 특징(예: 얼굴 표정)에 의존하는 데서 비롯하는 한계를 극복하기 위해 뷰로그 콘텐츠의 객체 지향 그래프 표현 방식을 도입하는 것.
  • 우울증 또는 고위험 잠재성으로 확인된 환자로부터의 뷰로그 데이터를 철저히 수집하여 임상적 관련성을 확보하는 것.
  • 기본 데이터셋에서의 일반화 능력을 평가하여 다양한 데이터 분포에 걸쳐 확장 가능한지 확인하는 것.
  • 실제 사용자가 생성한 뷰로그를 기반으로 한 조기 우울증 탐지에 효과적이고 해석 가능한 도구를 제공하는 것.

제안 방법

  • 모델은 YOLOv5를 사용해 각 뷰로그에서 시각적 객체(예: 사람, 컵, 침대)를 탐지하고, 객체 쌍 간의 공존 빈도를 그래프 간선으로 계산함으로써 객체 공존 그래프를 구축한다.
  • 다중모달 특징은 세 가지 소스에서 추출된다: 시각적 객체(여기서는 YOLOv5 사용), 메타데이터(제목, 설명, 지속 시간)는 KoBERT를 통해, 프레임의 시각적 특징은 ResNet을 통해 추출된다.
  • 교차 어텐션 메커니즘이 적용되어 세 모odal 간의 표현을 동적으로 주시하고 융합한다—객체 그래프, 시각적 특징, 텍스트 메타데이터.
  • 객체 지향 그래프 인코더는 그래프 주의망(GATs)을 사용해 이웃 관계를 기반으로 한 문맥 기반 노드 표현을 학습한다.
  • 최종 다중모달 표현은 분류기 헤드에 입력되어 우울증 또는 고위험 우울증 상태를 예측한다.
  • 모델는 교차 엔트로피 손실을 사용해 엔드 투 엔드로 훈련되며, 표준 평가 지표(정확도, F1 스코어)를 통해 평가된다.

실험 결과

연구 질문

  • RQ1다양한 데이터 유형을 활용한 다중모달, 객체 지향 그래프 어텐션 모델이 유튜브 뷰로그에서 우울증을 효과적으로 탐지할 수 있는가?
  • RQ2시각적 객체, 메타데이터, 그래프 구조적 관계를 통합함으로써 단일모달 또는 비그래프 기반 접근 방식보다 탐지 성능이 향상되는가?
  • RQ3다른 언어나 데이터 분포를 가진 데이터셋으로도 일반화 가능한가?
  • RQ4특정 객체 또는 객체 공존 패턴이 뷰로그에서 우울증 또는 고위험 상태와 유의미하게 관련되어 있는가?
  • RQ5임상 진단된 뷰로그를 사용함으로써 모델의 신뢰성과 임상적 관련성이 향상되는가?

주요 결과

  • MOGAM은 임상 진단을 받은 환자 또는 고위험 잠재성을 가진 individuals의 뷰로그로 구성된 주요 데이터셋에서 87.1%의 정확도와 88.8%의 F1 스코어를 달성했다.
  • 모델는 강력한 확장성을 보였으며, 기준 데이터셋에서 0.61의 F1 스코어를 기록하여 이전 최고 성능 모델들과 유사한 성능을 보였다.
  • 칼라, 포크, 케이크, 핸드백, 샌드위치와 같은 객체들이 우울증 상태와 통계적으로 유의미하게 관련되어 있었으며, p-값이 강력한 분류 능력을 나타냈다.
  • 객체 출현 빈도는 일상 그룹에서 우울증 및 고위험 잠재성 그룹보다 높았으며, 임상 상태에서 객체 사용 패턴의 변화를 시사했다.
  • p-값이 가장 낮은 상위 5개의 객체(칼라, 포크, 케이크, 핸드백, 샌드위치)는 그룹 간 평균 출현 횟수가 뚜렷하게 다름을 보였으며, 잠재적 진단 가치를 지녔다.
  • 후행 분석을 통해 식품 관련 객체가 우울증 및 고위험 그룹에서 유의미하게 더 많이 나타나는 것으로 확인되어, 증상 표현과의 관련성을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.