[論文レビュー] Social Media-based Substance Use Prediction
本稿では、Facebookの「いいね」および「ステータス更新」を活用して、物質使用症(SUD)を予測するマルチビュー型の教師なし機械学習フレームワークを提案する。タバコ使用では86% AUC、アルコール使用では81%、薬物使用では84%のAUCを達成し、既存手法を上回った。広大な教師なしソーシャルメディアデータからテキストマイニングと特徴学習を統合することで、SUDの検出を向上させるとともに、SUDと関連する行動的兆候を解明した。
In this paper, we demonstrate how the state-of-the-art machine learning and text mining techniques can be used to build effective social media-based substance use detection systems. Since a substance use ground truth is difficult to obtain on a large scale, to maximize system performance, we explore different feature learning methods to take advantage of a large amount of unsupervised social media data. We also demonstrate the benefit of using multi-view unsupervised feature learning to combine heterogeneous user information such as Facebook `"likes" and "status updates" to enhance system performance. Based on our evaluation, our best models achieved 86% AUC for predicting tobacco use, 81% for alcohol use and 84% for drug use, all of which significantly outperformed existing methods. Our investigation has also uncovered interesting relations between a user's social media behavior (e.g., word usage) and substance use.
研究の動機と目的
- 大規模かつ教師なしのソーシャルメディアデータを活用して、物質使用症(SUD)をスケーラブルかつコスト効率よく検出するための手法を開発すること。
- 特にFacebookの「いいね」と「ステータス更新」といった異種のユーザー情報をマルチビュー学習によって統合することで、予測性能を向上させること。
- 相関分析を通じて、ソーシャルメディア上の言語使用とSUDとの間の解釈可能な関係を解明すること。
- 教師あり手法に依存する従来のアプローチと比較して、教師なしおよびマルチビュー特徴学習がSUD予測において優れていることを実証すること。
提案手法
- ラベルなしの大規模なソーシャルメディアデータに対して、教師なし特徴学習手法(SPEおよびSLE)を適用し、意味のあるユーザー表現を抽出した。
- Facebookの「いいね」と「ステータス更新」という2つの異なるデータモダリティからの特徴を統合するマルチビュー学習を適用し、包括的なユーザープロファイルを構築した。
- 潜在ディリクレ割り当て(LDA)を用いて、「いいね」と「ステータス更新」の両方におけるトピック分布を特定し、SUD関連のテーマを同定した。
- LIWC(言語的インクワイアリ・アンド・ワードカウント)を用いてステータス更新の言語的特徴を分析し、SUDの結果と相関をとった。
- 組み合わせた特徴を用いて教師ありモデル(例:ロジスティック回帰)を訓練し、SUDを予測した。主な評価指標としてAUCを用いた。
- スピアーマンの順位相関分析を実施し、特定の語彙、トピック、および物質使用行動との有意な関連を同定した。
実験結果
リサーチクエスチョン
- RQ1大規模なソーシャルメディアデータからの教師なし特徴学習は、教師ありのみのベースラインと比較して、SUD予測性能を顕著に向上させることができるか?
- RQ2Facebookの「いいね」と「ステータス更新」のような異種のデータソースを統合することで、SUD予測モデルの正確性はどのように向上するか?
- RQ3ソーシャルメディアコンテンツにおける言語的および行動的パターンのうち、物質使用症と顕著に相関するものは何か?
- RQ4「いいね」と「ステータス更新」における特定のトピックは、タバコ、アルコール、または薬物使用をどの程度正確に予測できるか?
- RQ5ソーシャルメディア行動から推定される人口統計的および心理的特徴は、SUDリスクとどのように関連しているか?
主な発見
- 最も優れたモデルは、タバコ使用で86% AUC、アルコール使用で81%、薬物使用で84%のAUCを達成し、既存手法を顕著に上回った。
- 「いいね」と「ステータス更新」を統合するマルチビュー学習は、単一のデータモダリティのみを用いたモデルと比較して、顕著な性能向上をもたらした。
- 怒りを示す語彙(「嫌い」「殺す」)および健康関連語彙(「クリニック」「薬」)は、薬物使用と正の相関を示したのに対し、過去形の語彙(「した」「前」)は負の相関を示した。
- 女性を指す語彙(「女の子」「女性」)はアルコール使用と正の相関を示したが、男性を指す語彙(「少年」「男」)は薬物使用と負の相関を示した。
- 「V for Vendetta」や「ブーンドック・サントゥス」のような映画や、ロック音楽の好みが「いいね」に見られる場合、タバコおよび薬物使用と正の相関を示した。
- ナイトライフ関連および乱暴な言語を含むトピックは、アルコールおよびタバコ使用と正の関連を示したが、学校関連および家族中心のトピックはSUDと負の相関を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。