Skip to main content
QUICK REVIEW

[論文レビュー] Data set creation and empirical analysis for detecting signs of depression from social media postings

S Kayalvizhi, D Thenmozhi|arXiv (Cornell University)|Feb 7, 2022
Mental Health via Writing被引用数 18
ひとこと要約

本稿では、Redditの投稿を用いて、『うつ病でない』、『軽度のうつ病』、『重度のうつ病』の3段階のうつ病の程度を検出するための、新規で公開可能なデータセットを紹介する。本研究では、SMOTEによるデータ拡張を伴う従来の機械学習モデルを採用し、Word2Vec埋め込みとランダムフォレスト分類器を用いて、F1スコアと正答率が0.877に達し、不均衡データに対して顕著な性能向上を達成した。

ABSTRACT

Depression is a common mental illness that has to be detected and treated at an early stage to avoid serious consequences. There are many methods and modalities for detecting depression that involves physical examination of the individual. However, diagnosing mental health using their social media data is more effective as it avoids such physical examinations. Also, people express their emotions well in social media, it is desirable to diagnose their mental health using social media data. Though there are many existing systems that detects mental illness of a person by analysing their social media data, detecting the level of depression is also important for further treatment. Thus, in this research, we developed a gold standard data set that detects the levels of depression as `not depressed', `moderately depressed' and `severely depressed' from the social media postings. Traditional learning algorithms were employed on this data set and an empirical analysis was presented in this paper. Data augmentation technique was applied to overcome the data imbalance. Among the several variations that are implemented, the model with Word2Vec vectorizer and Random Forest classifier on augmented data outperforms the other variations with a score of 0.877 for both accuracy and F1 measure.

研究の動機と目的

  • ソーシャルメディアのテキストから、単にうつ病の有無を検出するのではなく、その重症度レベルを検出するという研究ギャップを埋めること。
  • 『うつ病でない』、『軽度のうつ病』、『重度のうつ病』という3段階のうつ病重症度でアノテートされた、ゴールドスタンダードで公開可能なデータセットを作成すること。
  • このデータセット上で従来の機械学習モデルを実証的に評価し、データ拡張の影響がモデル性能に与える影響を評価すること。
  • ソーシャルメディアデータを用いた計算的メンタルヘルス分野の今後の研究のベンチマークを提供すること。

提案手法

  • メンタルヘルスに焦点を当てたRedditのサブレッド、例えばr/depression や r/Anxiety からソーシャルメディアのテキストを収集した。
  • 分野の専門家を用いて、各投稿を『うつ病でない』、『軽度のうつ病』、『重度のうつ病』のいずれかのクラスにアノテートした。
  • TF-IDF、GloVe、Word2Vecの3つの埋め込み手法を用いてテキスト特徴量を抽出した。
  • 不均衡なデータセットをバランスさせるために、合成少数オーバーサンプリング技術(SMOTE)を適用した。特に『軽度のうつ病』クラスの過剰な代表性に対処した。
  • ランダムフォレスト、SVM、KNN、ロジスティック回帰、MLPといった複数の従来の分類器を、元のデータおよび拡張済みデータ上で訓練・評価した。
  • F1スコアや正答率といった指標を用いてモデル性能を比較し、特にデータ拡張の影響に注目した。

実験結果

リサーチクエスチョン

  • RQ1専門家によるアノテーションを伴うReddit投稿を用いて、ソーシャルメディアのテキストからうつ病の重症度レベルを多クラス分類可能なデータセットを効果的に構築できるか?
  • RQ2この新規データセット上で訓練された従来の機械学習モデルは、うつ病の重症度レベルを分類する際に、どの程度の性能を示すか?
  • RQ3SMOTEによるデータ拡張は、この不均衡なうつ病重症度データセットにおいて、どの程度モデル性能を向上させるか?
  • RQ4TF-IDF、GloVe、Word2Vecのうち、どのテキスト表現手法が、特定の分類器と組み合わせた際に、このデータセットで最も高い性能を発揮するか?
  • RQ5ソーシャルメディアのテキストからうつ病の程度を検出するための最適なモデル構成(埋め込み手法+分類器)は何か?

主な発見

  • Word2Vec埋め込みとランダムフォレスト分類器を組み合わせたモデルが、拡張済みデータセット上で最高の性能を示し、F1スコアと正答率の両方が0.877に達した。
  • SMOTEによるデータ拡張により、元のデータで訓練されたベースラインモデルと比較して、F1スコアが23%向上し、正答率が12%向上した。
  • テストした分類器の中で、ランダムフォレストが一貫して他のモデルを上回り、特にデータ拡張後にはF1スコアが0.877に達する最高の性能を発揮した。
  • 『軽度のうつ病』クラスが他の2クラスと比べて著しく多く、SMOTEのようなデータバランス技術の導入が不可欠であることを示した。
  • Word2Vecとランダムフォレストを組み合わせたモデルは、同データセット上でTF-IDFやGloVeを用いたモデルを上回る頑健性と一般化性能を示した。
  • 本データセットはGitHubで公開されており、再現性と今後の計算的メンタルヘルス研究におけるベンチマークの実施を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。