Skip to main content
QUICK REVIEW

[論文レビュー] What are We Depressed about When We Talk about COVID19: Mental Health Analysis on Tweets Using Natural Language Processing

Irene Li, Yixin Li|arXiv (Cornell University)|Apr 22, 2020
Sentiment Analysis and Opinion Mining参考文献 13被引用数 14
ひとこと要約

本稿では、COVID-19関連ツイートの感情分類を目的とした多言語Bertベースのモデルを提案し、1,000件の手動ラベル付き英語ツイートを含むEmoCTデータセットを導入した。主な感情的要因として、ロックダウンに関する不安や、経済的・健康的懸念と関連する喪失感が特定され、自然言語処理を用いて時間的・トピック的変化に伴う感情傾向の分析が行われた。

ABSTRACT

The outbreak of coronavirus disease 2019 (COVID-19) recently has affected human life to a great extent. Besides direct physical and economic threats, the pandemic also indirectly impact people's mental health conditions, which can be overwhelming but difficult to measure. The problem may come from various reasons such as unemployment status, stay-at-home policy, fear for the virus, and so forth. In this work, we focus on applying natural language processing (NLP) techniques to analyze tweets in terms of mental health. We trained deep models that classify each tweet into the following emotions: anger, anticipation, disgust, fear, joy, sadness, surprise and trust. We build the EmoCT (Emotion-Covid19-Tweet) dataset for the training purpose by manually labeling 1,000 English tweets. Furthermore, we propose and compare two methods to find out the reasons that are causing sadness and fear.

研究の動機と目的

  • SNSの言語的表現を通じて、COVID-19パンデミックに対する一般大衆のメンタルヘルス反応を理解すること。
  • パンデミック関連ツイートにおける感情分類のためのラベル付きでドメイン特化されたデータセットの不足に対処すること。
  • リアルタイムのSNSデータから、悲しみや恐怖の要因を検出可能な多言語感情分類モデルの開発。
  • ロックダウンやマスク着用など、パンデミックの主要な出来事に伴う感情反応の時間的・トピック的変化を分析すること。
  • 健康危機時の国際的・言語的文脈を考慮した公衆感情の長期的モニタリングを支援するため、文化的・言語的多様性を反映した分析手法の構築。

提案手法

  • 8つの感情(怒り、期待、嫌悪、恐怖、喜び、悲しみ、驚き、信頼)に分類された1,000件の英語ツイートを手動でラベル付けすることで、EmoCTデータセットを構築した。
  • EmoCTデータセット上で、単一ラベルおよびマルチラベル感情分類の両方のタスクに、多言語Bertモデルを微調整した。
  • 名詞および名詞句の品詞タグ付け(POS tagging)を用いたキーワード抽出により、悲しみや恐怖に関連する顕著なトピックを同定した。
  • 感情ラベルと抽出されたキーワードの間の相関分析を実施し、ネガティブな感情の根本的要因を特定した。
  • 微調整済みBertモデルを用いて、大規模なツイートデータ(最大日次300万件)を対象に、感情傾向の時間的推移を追跡した。
  • 2020年3月25日から4月7日までの期間にわたり、特定のキーワード(マスク、ロックダウン)について、日次感情分布を分析する事例研究を実施した。

実験結果

リサーチクエスチョン

  • RQ1COVID-19に関するSNSの公的議論において、主にどのような感情的反応(例:恐怖、悲しみ)が示されているか?
  • RQ2パンデミック関連ツイートにおいて、悲しみや恐怖と強く相関するトピックやキーワードは何か?
  • RQ3ロックダウンの発表などの公衆衛生上の出来事に伴い、感情の傾向はどのように変化するか?
  • RQ4マスクとロックダウンに関する議論において、感情的反応はどのように異なるか?
  • RQ5多言語Bertモデルは、高精度で多言語のパンデミック関連ツイートにおける感情を効果的に分類できるか?

主な発見

  • 微調整済みの多言語Bertモデルは、EmoCTデータセットを用いた単一ラベルおよびマルチラベル感情分類タスクで優れた性能を示した。
  • マスクに関するツイートは、一般のパンデミック関連コンテンツと比較して、予測と信頼の割合が高かったため、より中立的または希望的なトーンを示していた。
  • ロックダウンに関するツイートは、主にネガティブな傾向を示し、特に2020年3月27日に米国で確認された感染者数が10万人に達した日には、悲しみと嫌悪のレベルが著しく高まった。
  • 2020年3月27日にロックダウンに関する議論で嫌悪感情が急増したのは、パンデミックの深刻さに関する世界的な報道と、広範な社会的制限の導入が重なったことに起因していると考えられる。
  • キーワード分析から、「経済」「トランプ大統領」「ホワイトハウス」「学校の閉鎖」「銃器店」などが、しばしばネガティブな感情と関連していることが判明した。
  • 本研究では、言語的および地理的文脈が感情表現に顕著に影響を与えることが明らかになったことから、多言語的メンタルヘルスモニタリングの必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。