[論文レビュー] Suicidal Ideation Detection on Social Media: A Review of Machine Learning Methods
この論文は、Twitter、Reddit、Weiboなどのプラットフォームからのテクストおよび言語的特徴を用いて、ソーシャルメディア上での自殺的思考の検出に向けた24件の機械学習研究をレビューしている。SVM、ランダムフォレスト、LSTM-CNNなどの深層学習モデルが最も優れた性能を示しており、F1スコアは最大94.1%に達した。一方、現在のデータセットにおけるアラビア語の研究が不足していることから、アラビア語の研究の必要性が強調されている。
Social media platforms have transformed traditional communication methods by allowing users worldwide to communicate instantly, openly, and frequently. People use social media to express their opinion and share their personal stories and struggles. Negative feelings that express hardship, thoughts of death, and self-harm are widespread in social media, especially among young generations. Therefore, using social media to detect and identify suicidal ideation will help provide proper intervention that will eventually dissuade others from self-harming and committing suicide and prevent the spread of suicidal ideations on social media. Many studies have been carried out to identify suicidal ideation and behaviors in social media. This paper presents a comprehensive summary of current research efforts to detect suicidal ideation using machine learning algorithms on social media. This review 24 studies investigating the feasibility of social media usage for suicidal ideation detection is intended to facilitate further research in the field and will be a beneficial resource for researchers engaged in suicidal text classification.
研究の動機と目的
- ソーシャルメディアのコンテンツにおける自殺的思考の検出に用いられた機械学習手法について、包括的なレビューを提供すること。
- さまざまなソーシャルメディアプラットフォームおよび言語において、さまざまな教師ありおよび教師なし機械学習モデルのパフォーマンスを分析・比較すること。
- 自殺的思考を予測するうえで最も効果的な特徴量セット(言語的、構文的、感情分析ベースの特徴など)を特定すること。
- 特に、アラビア語のコンテンツに焦点を当てた研究が不足していることから、アラビア圏におけるソーシャルメディアの利用増加を踏まえた研究ギャップを浮き彫りにすること。
- テキスト分類手法を用いた自動自殺的思考検出システムの開発を進める研究者にとっての参考資料として提供すること。
提案手法
- 2014年から2020年までの間で、自殺、思考、検出、機械学習に関連するキーワードを含む論文を対象に、ScopusおよびGoogle Scholarを用いた体系的文献レビューを実施した。
- Twitter、Reddit、Weiboなどのプラットフォームからユーザー生成コンテンツを対象に、自殺的思考を検出するために教師あり機械学習モデルを適用した24件の研究を分析した。
- 一般的な特徴量エンジニアリング手法には、TF-IDF、N-gram、品詞タギング、LIWC語彙、感情分析、GloVe や word2vec などの事前学習済み埋め込みが含まれた。
- CNN、LSTM、Bi-LSTM、およびハイブリッドアーキテクチャ(例:LSTM-CNN)などの深層学習モデルは、階層的なテキスト表現を学習する能力について評価された。
- パフォーマンスは、標準的な指標(正解率、適合率、再現率、F1スコア)を用いて測定され、研究およびプラットフォームごとに集約された結果が提示された。
- データセット収集方法についても検討された。具体的には、自殺用語辞書に基づくキーワード抽出や、精神保健専門家による手動アノテーションが含まれる。

実験結果
リサーチクエスチョン
- RQ1多様なソーシャルメディアプラットフォームにおいて、自殺的思考検出に最も高いパフォーマンスを示す機械学習モデルは何か?
- RQ2ユーザー投稿における自殺的思考の予測に最も予測的であるテキスト的・言語的・メタ特徴量は何か?
- RQ3英語、中国語、日本語、アラビア語などの異なる言語において、モデルのパフォーマンスおよび特徴量の重要度はどのように変化するか?
- RQ4データセットのサイズ、アノテーション品質、言語的多様性という観点から、現在のデータセットの限界は何か?
- RQ5特に、アラビア語のような未発表言語に焦点を当てた研究ギャップは何か?
主な発見
- SVMとランダムフォレストが最も頻繁に使用された機械学習モデルであり、SVMは1件の研究でTwitterデータセットを用いて94.1%の最高F1スコアを達成した。
- LSTM-CNNなどの深層学習モデルは、Twitterデータセットで93.4%のF1スコアを記録し、一部のケースでは従来のモデルを上回った。
- GloVe やコンテキスト特徴(例:感情、代名詞、呪いの言葉)などの事前学習済み埋め込みの使用は、複数の研究においてモデルパフォーマンスを顕著に向上させた。
- 290万件のツイートを含む日本の研究では、大規模なデータセットを用いることで高い適合率と再現率が達成されたが、言語やアノテーション手法によってパフォーマンスにばらつきが見られた。
- 英語および中国語においては高いパフォーマンスを示したが、アラビア語に焦点を当てた顕著な研究は見つからず、アラビア圏における重要な研究ギャップが示された。
- LIWC、TF-IDF、品詞タギングなどの言語的・構文的・感情分析特徴量を組み合わせた特徴量セットは、プラットフォームを問わず、単一特徴量アプローチを上回る一貫したパフォーマンスを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。