Skip to main content
QUICK REVIEW

[논문 리뷰] A Multitask Deep Learning Approach for User Depression Detection on Sina Weibo

Yiding Wang, Zhenyi Wang|arXiv (Cornell University)|2020. 08. 26.
Mental Health via Writing참고 문헌 38인용 수 15
한 줄 요약

이 논문은 신장 위보에서 우울증을 탐지하기 위해 XLNet의 텍스트 임베딩과 사용자 게시물의 수작업 통계적 특징(텍스트, 사회적 행동, 이미지)을 통합하는 멀티태스크 딥러닝 모델인 FusionNet을 제안한다. 새로 구축한 WU3D 데이터셋에서 F1 스코어 0.9772를 기록하여 기존 모델에 비해 더 뛰어난 성능과 불균형 데이터에서의 강건성을 입증한다.

ABSTRACT

In recent years, due to the mental burden of depression, the number of people who endanger their lives has been increasing rapidly. The online social network (OSN) provides researchers with another perspective for detecting individuals suffering from depression. However, existing studies of depression detection based on machine learning still leave relatively low classification performance, suggesting that there is significant improvement potential for improvement in their feature engineering. In this paper, we manually build a large dataset on Sina Weibo (a leading OSN with the largest number of active users in the Chinese community), namely Weibo User Depression Detection Dataset (WU3D). It includes more than 20,000 normal users and more than 10,000 depressed users, both of which are manually labeled and rechecked by professionals. By analyzing the user's text, social behavior, and posted pictures, ten statistical features are concluded and proposed. In the meantime, text-based word features are extracted using the popular pretrained model XLNet. Moreover, a novel deep neural network classification model, i.e. FusionNet (FN), is proposed and simultaneously trained with the above-extracted features, which are seen as multiple classification tasks. The experimental results show that FusionNet achieves the highest F1-Score of 0.9772 on the test dataset. Compared to existing studies, our proposed method has better classification performance and robustness for unbalanced training samples. Our work also provides a new way to detect depression on other OSN platforms.

연구 동기 및 목표

  • 중국어 소셜 미디어에서 사용자 수준의 우울증 탐지에 적합한 대규모 수작업 레이블이 부여된 데이터셋의 부족을 해결하기 위해.
  • 텍스트, 사회적 행동, 이미지에서 유래한 다양한 사용자 특징을 통합하여 우울증 탐지의 분류 성능과 강건성을 향상시키기 위해.
  • 우울증 탐지 데이터셋에서의 클래스 불균형 문제를 효과적으로 다룰 수 있는 딥러닝 모델을 개발하기 위해.
  • 다른 온라인 소셜 네트워크 플랫폼에서도 적용 가능한 일반화 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 정신건강 전문가의 검토를 거친 30,000명 이상의 수작업 레이블이 부여된 사용자(정상 20,000명, 우울 10,000명)를 포함하는 위보 사용자 우울증 탐지 데이터셋(WU3D)을 구축하였다.
  • 텍스트, 사회적 행동, 이미지 콘텐츠에서 10개의 통계적 특징을 추출하였으며, 정상 사용자와 우울 사용자 간의 분포 차이가 뚜렷하게 나타났다.
  • 텍스트 시퀀스의 문맥적 단어 임베딩을 생성하기 위해 사전 학습된 언어 모델 XLNet을 활용하였으며, 장문의 텍스트 분류를 최적화하였다.
  • 단어 벡터 분류와 통계적 특징 분류를 동시에 학습하는 멀티태스크 딥 네ural 네트워크인 FusionNet을 설계하여 특징 표현을 향상시켰다.
  • 다양한 작업 간에 표현을 공유함으로써 전이 학습 중 정보 손실를 줄이고 일반화 능력을 향상시켰다.
  • 특성 불균형 상황에서도 수렴성과 안정성을 향상시키기 위해 적응형 학습률을 적용한 Nadam 옵timizer를 사용하였다.

실험 결과

연구 질문

  • RQ1대규모 수작업 레이블이 부여된 데이터셋은 신장 위보에서 우울증 탐지 모델의 성능을 향상시킬 수 있는가?
  • RQ2통합된 텍스트, 행동, 시각적 특징은 정상 사용자와 우울 사용자를 어떻게 구분하는 데 기여하는가?
  • RQ3공유 표현을 활용한 멀티태스크 학습은 불균형 데이터셋에서 분류 정확도와 강건성을 얼마나 향상시키는가?
  • RQ4XLNet과 같은 사전 학습된 언어 모델은 장문의 사용자 텍스트에서 성능 향상에 기여하는가?
  • RQ5데이터 불균형 상황에서 전통적 분류기와 비교해 FusionNet의 F1 스코어와 안정성은 어떠한가?

주요 결과

  • FusionNet는 WU3D 테스트 세트에서 0.9772의 최고 F1 스코어를 기록하여 LR, SVM, RF, GBDT와 같은 베이스라인 모델을 크게 앞섰다.
  • FusionNet의 인트라그룹 F1-스코어 변동성(IFV)은 1.01×10⁻⁵로 모든 분류기 중에서 가장 낮아, 클래스 불균형에 대한 뛰어난 강건성을 보였다.
  • 모든 10개의 수작업 통계적 특징이 정상 사용자와 우울 사용자 간에 유의미한 분포 차이를 보였으며, 이는 이들이 우울증 탐지에 관련이 있음을 확인했다.
  • XLNet는 최적의 임베딩 길이와 조합되었을 때 장문의 텍스트 시퀀스 처리에 뛰어난 성능을 보였으며, 본 연구에서 다른 임베딩 전략보다 뛰어났다.
  • FusionNet의 멀티태스크 학습 프레임워크는 전이 학습 중 특징 정보 손실를 효과적으로 줄여 전체 모델의 일반화 능력을 향상시켰다.
  • 30,000개 이상의 레이블이 부여된 사용자 샘플을 포함하는 본 연구에서 제안한 WU3D 데이터셋은 향후 온라인 우울증 탐지 연구를 위한 유의미한 기준이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.