Skip to main content
QUICK REVIEW

[논문 리뷰] Using Linguistic Features to Estimate Suicide Probability of Chinese Microblog Users

Lei Zhang, Xiaolei Huang|arXiv (Cornell University)|2014. 11. 04.
Mental Health via Writing참고 문헌 18인용 수 18
한 줄 요약

이 연구는 소셜 미디어 데이터를 활용해 중국의 미니블로거 사용자들 사이에서 자살 위험 확률을 예측하기 위한 기계학습 기반 접근법을 제안한다. 신장위보(신장웨이보) 게시물에서 추출한 언어적 특징을 바탕으로, LIWC와 LDA 기반 토픽 모델링을 1,041명의 사용자에게 적용한 결과, 유추된 토픽이 LIWC 특징보다 우수한 성능을 보이며, 최고의 RMSE는 11.68을 기록했다. 또한, 유추된 토픽은 훈련된 토픽과 동일하거나 더 뛰어난 예측 능력을 보이며, 더 높은 재사용 가능성을 지닌다.

ABSTRACT

If people with high risk of suicide can be identified through social media like microblog, it is possible to implement an active intervention system to save their lives. Based on this motivation, the current study administered the Suicide Probability Scale(SPS) to 1041 weibo users at Sina Weibo, which is a leading microblog service provider in China. Two NLP (Natural Language Processing) methods, the Chinese edition of Linguistic Inquiry and Word Count (LIWC) lexicon and Latent Dirichlet Allocation (LDA), are used to extract linguistic features from the Sina Weibo data. We trained predicting models by machine learning algorithm based on these two types of features, to estimate suicide probability based on linguistic features. The experiment results indicate that LDA can find topics that relate to suicide probability, and improve the performance of prediction. Our study adds value in prediction of suicidal probability of social network users with their behaviors.

연구 동기 및 목표

  • 소셜 미디어 데이터를 활용해 확장 가능하고 사전에 위험을 탐지할 수 있는 자살 위험 탐지 시스템을 개발하기 위해.
  • 미니블로그에서 유도된 언어적 특징이 높은 정확도로 자살 고려를 예측할 수 있는지 조사하기 위해.
  • LIWC 기반 특징과 LDA를 사용한 토픽 모델링 간의 예측 성능을 비교하기 위해.
  • 전체 데이터셋에서 훈련된 토픽과 고위험 사용자군에서 유추된 토픽 간의 예측 성능 차이가 있는지 평가하기 위해.
  • 유추된 토픽이 정신건강 위험 예측에 있어 재사용 가능성과 일반화 잠재력이 있는지 탐색하기 위해.

제안 방법

  • 1,041명의 사용자로부터 신장웨이보 게시물과 SPS 점수를 수집하여 레이블이 부여된 데이터셋을 구성하였다.
  • 감정 및 인지 상태와 관련된 어휘적 특징을 추출하기 위해 중국어판 LIWC를 적용하였다.
  • 미니블로그 텍스트에서 토픽 특징을 추출하기 위해 잠재디리히레트 분포(Latent Dirichlet Allocation, LDA)를 사용하였다.
  • LIWC 특징, 훈련된 토픽, 유추된 토픽을 사용하여 지도 기반 기계학습 모델(단계적 선형 회귀)을 훈련시켰다.
  • 다양한 특징 조합과 토픽 수에 대해 RMSE를 평가 지표로 사용하여 모델 성능을 비교하였다.
  • 전체 데이터셋에서 훈련된 토픽과 고위험 하위군에서 유추된 토픽의 예측 능력과 재사용 가능성을 평가하였다.

실험 결과

연구 질문

  • RQ1중국의 미니블로그 게시물에서 유도된 언어적 특징이 수용 가능한 정확도로 자살 확률을 예측할 수 있는가?
  • RQ2LDA에서 유도된 토픽 모델이 전통적인 어휘 분석(LIWC)보다 자살 고려를 예측하는 데 더 뛰어나게 성능을 보이는가?
  • RQ3전체 데이터셋에서 훈련된 토픽과 고위험 하위군에서 유추된 토픽 간의 예측 성능에 유의미한 차이가 존재하는가?
  • RQ4작은 고위험 서브셋에서 훈련된 유추된 토픽이 훈련된 토픽과 비교해 유사하거나 더 뛰어난 성능을 낼 수 있는가?
  • RQ5LIWC와 토픽 특징을 조합하면 예측 정확도가 향상되는가? 만약 그렇다면 어떤 조건에서 그런가?

주요 결과

  • 유추된 토픽을 사용한 최고 성능 모델은 70개의 토픽을 사용하여 RMSE 11.68을 기록했으며, 이는 LIWC 기반 기준선(RMSE = 15.43)을 크게 뛰어넘었다.
  • LDA 기반 토픽 모델링은 LIWC보다 더 높은 정확도를 보였으며, 이는 토픽 특징이 어휘 빈도보다 더 세밀한 심리적 신호를 포착할 수 있음을 확인했다.
  • 유추된 토픽은 훈련된 토픽과 동일하거나 더 높은 예측 능력을 보였으며, 특히 높은 토픽 수에서 더 뛰어난 성능과 안정성을 보였다.
  • 단일 토픽과 SPS 점수 간의 상관계수 최대값은 0.15에 도달했으며, 더 높은 토픽 수에서는 성능 향상이 없었고, 이는 70~100개 이상의 토픽에서 수익 감소 현상이 나타남을 시사한다.
  • LIWC와 유추된 토픽을 조합해도 성능 향상이 없었으며, LIWC + 훈련된 토픽 조합은 높은 토픽 수에서만 약간의 성능 향상이 있었다.
  • 유추된 토픽은 전체 데이터셋을 다시 훈련하지 않아도 새로운 데이터에 적용할 수 있어, 훈련된 토픽보다 더 높은 재사용 가능성을 지녔다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.