Skip to main content
QUICK REVIEW

[논문 리뷰] What are We Depressed about When We Talk about COVID19: Mental Health Analysis on Tweets Using Natural Language Processing

Irene Li, Yixin Li|arXiv (Cornell University)|2020. 04. 22.
Sentiment Analysis and Opinion Mining참고 문헌 13인용 수 14
한 줄 요약

이 논문은 코로나19 관련 트윗에서 감정을 분류하기 위한 다국어 BERT 기반 모델을 제안하며, 수작업으로 레이블링된 1,000건의 영어 트윗을 포함한 EmoCT 데이터셋을 도입한다. 주요 감정 유발 요인으로는 봉쇄에 대한 두려움과 경제 및 건강 문제와 관련된 슬픔을 특정하며, 자연어 처리를 통해 시간과 주제별 감성 추세를 분석한다.

ABSTRACT

The outbreak of coronavirus disease 2019 (COVID-19) recently has affected human life to a great extent. Besides direct physical and economic threats, the pandemic also indirectly impact people's mental health conditions, which can be overwhelming but difficult to measure. The problem may come from various reasons such as unemployment status, stay-at-home policy, fear for the virus, and so forth. In this work, we focus on applying natural language processing (NLP) techniques to analyze tweets in terms of mental health. We trained deep models that classify each tweet into the following emotions: anger, anticipation, disgust, fear, joy, sadness, surprise and trust. We build the EmoCT (Emotion-Covid19-Tweet) dataset for the training purpose by manually labeling 1,000 English tweets. Furthermore, we propose and compare two methods to find out the reasons that are causing sadness and fear.

연구 동기 및 목표

  • 사회 미디어 언어를 통해 코로나19 패닉에 대한 대중의 정신건강 반응을 이해하기 위해.
  • 팬데믹 관련 트윗에서 감정 분류를 위한 레이블링된 도메인 특화 데이터셋의 부족을 해결하기 위해.
  • 실시간 소셜 미디어 데이터에서 슬픔과 공포 유발 요인을 탐지할 수 있는 다국어 감정 분류 모델을 개발하기 위해.
  • 봉쇄와 마스크 착용과 같은 주요 팬데믹 이벤트에 대한 감정 반응의 시간적 및 주제적 변동을 분석하기 위해.
  • 건강 위기 동안 다문화 및 다국어 정서 분석을 가능하게 하여 장기적인 정신건강 모니터링을 지원하기 위해.

제안 방법

  • 8개 감정(분노, 기대, 혐오, 공포, 기쁨, 슬픔, 놀람, 신뢰)으로 나누어 수작업으로 1,000건의 영어 트윗을 레이블링하여 EmoCT 데이터셋을 구축하였다.
  • EmoCT 데이터셋에서 단일 레이블 및 다중 레이블 감정 분류를 위해 다국어 BERT 모델을 미세조정하였다.
  • 명사 및 명사구의 품사 태깅을 사용한 키워드 추출을 통해 슬픔과 공포와 관련된 주요 주제를 특정하였다.
  • 감정 레이블과 추출된 키워드 간의 상관관계 분 析을 통해 부정적 감정의 근본 원인을 규명하였다.
  • 미세조정된 BERT 모델을 사용해 대규모 트윗 데이터(최대 일일 300만 건)에서 감정 추세를 시간에 따라 추적하였다.
  • 2020년 3월 25일부터 4월 7일까지의 일일 감정 분포를 분석하여 마스크와 봉쇄와 같은 특정 키워드에 대한 사례 연구를 수행하였다.

실험 결과

연구 질문

  • RQ1코로나19에 관한 대중의 소셜 미디어 논의에서 주로 나타나는 감정 반응(예: 공포, 슬픔)은 무엇인가?
  • RQ2팬데믹 관련 트윗에서 슬픔과 공포와 가장 강하게 관련된 주제나 키워드는 무엇인가?
  • RQ3봉쇄 발표와 같은 주요 보건 정책 이벤트에 따라 감정 추세는 어떻게 변화하는가?
  • RQ4마스크와 봉쇄에 대한 논의에서 감정 반응은 어떻게 다를까?
  • RQ5다국어 BERT 모델은 높은 정확도로 다국어 팬데믹 관련 트윗의 감정을 효과적으로 분류할 수 있는가?

주요 결과

  • 미세조정된 다국어 BERT 모델은 EmoCT 데이터셋을 사용해 단일 레이블 및 다중 레이블 감정 분류 작업에서 뛰어난 성능을 보였다.
  • '마스크'에 관해 논의하는 트윗는 일반적인 팬데믹 관련 콘텐츠보다 기대와 신뢰의 비율이 높았으며, 더 중립적이거나 희망적인 어조를 띠었다.
  • '봉쇄'에 관해 논의하는 트윗는 주로 부정적이었으며, 특히 2020년 3월 27일에 슬픔과 혐오 수준이 높았다. 이는 미국의 확진자 10만 명을 기록한 시점과 겹쳤다.
  • 3월 27일 봉쇄 논의에서 혐오 감정이 급격히 증가한 것은 팬데믹의 심각성과 광범위한 사회적 제한 조치에 대한 글로벌 뉴스가 영향을 미쳤을 가능성이 높다.
  • 키워드 분석 결과, '경제', '트럼프 대통령', '백악관', '학교 폐쇄', '총구매점'은 부정적 감정과 자주 연관되어 있었다.
  • 연구는 언어적 및 지리적 맥락이 감정 표현에 중대한 영향을 미친다는 점을 규명하였으며, 이는 다국어 정신건강 모니터링의 필요성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.