[論文レビュー] Using Linguistic Features to Estimate Suicide Probability of Chinese Microblog Users
本研究では、Sina Weibo投稿から抽出した言語的特徴を用いて、中国のマイクロブログ利用者の自殺確率を予測する機械学習手法を提案する。1,041人のユーザーのマイクロブログにLIWCおよびLDAベースのトピックモデリングを適用した結果、推定されたトピックがLIWC特徴を上回り、最良のRMSEは11.68を達成した。推定トピックは、訓練済みトピックと同等または優れた予測力を持つとともに、再利用性がより高いことが示された。
If people with high risk of suicide can be identified through social media like microblog, it is possible to implement an active intervention system to save their lives. Based on this motivation, the current study administered the Suicide Probability Scale(SPS) to 1041 weibo users at Sina Weibo, which is a leading microblog service provider in China. Two NLP (Natural Language Processing) methods, the Chinese edition of Linguistic Inquiry and Word Count (LIWC) lexicon and Latent Dirichlet Allocation (LDA), are used to extract linguistic features from the Sina Weibo data. We trained predicting models by machine learning algorithm based on these two types of features, to estimate suicide probability based on linguistic features. The experiment results indicate that LDA can find topics that relate to suicide probability, and improve the performance of prediction. Our study adds value in prediction of suicidal probability of social network users with their behaviors.
研究の動機と目的
- ソーシャルメディアデータを用いたスケーラブルで予防的な自殺リスク検出システムの開発を目的とする。
- マイクロブログからの言語的特徴が、高い正確性で自殺的想起を予測できるかどうかを調査すること。
- LIWCベースの特徴とLDAを用いたトピックモデリングの間で、予測性能を比較すること。
- 全データセットで訓練されたトピックと、高リスクユーザー群から推定されたトピックの間で、予測力に有意差があるかどうかを評価すること。
- 推定トピックが、メンタルヘルスリスク予測において、再利用性と一般化可能性をどのように果たすかを探索すること。
提案手法
- 1,041人のユーザーのSina Weibo投稿とSPSスコアを収集し、ラベル付きデータセットを構築した。
- 中国語版LIWCを用いて、感情状態および認知状態に関連する語彙的特徴を抽出した。
- マイクロブログテキストからトピック特徴を抽出するために、潜在ディリクレ配分(LDA)を用いた。
- LIWC特徴、訓練済みトピック、および推定トピックを用いて、逐次線形回帰を用いた教師あり機械学習モデルを訓練した。
- 異なる特徴の組み合わせとトピック数におけるモデル性能を、RMSEを指標として比較した。
- 全データセットから訓練されたトピックと、高リスクサブグループから推定されたトピックの両方について、予測力と再利用性を評価した。
実験結果
リサーチクエスチョン
- RQ1中国のマイクロブログ投稿からの言語的特徴は、妥当な正確性で自殺確率を予測できるか?
- RQ2LDAから導出されたトピックモデルは、伝統的な語彙解析(LIWC)を上回り、自殺的想起の予測に優れているか?
- RQ3全データセットで訓練されたトピックと、高リスクサブグループから推定されたトピックの間で、予測性能に有意差があるか?
- RQ4小規模な高リスクサブセットで訓練された推定トピックは、訓練済みトピックと同等または優れた性能を達成できるか?
- RQ5LIWCとトピック特徴を組み合わせることで予測正確性が向上するか?もしあるならば、どのような条件下で向上するか?
主な発見
- 最良のモデルは、70トピックの推定トピックを用いてRMSEが11.68に達し、LIWCベースライン(RMSE = 15.43)を顕著に上回った。
- LDAベースのトピックモデリングは、LIWCよりも予測正確性を向上させた。これは、トピック特徴が語彙カウントよりも洗練された心理的信号を捉えられることを確認した。
- 推定トピックは、特にトピック数が多い場合に、訓練済みトピックと同等または優れた予測力を示し、より高い安定性を示した。
- 1つのトピックとSPSスコアとの間の相関係数の最大値は0.15に留まり、トピック数が増加しても顕著な改善は見られず、70~100トピックを超えると限界効果が顕著になった。
- LIWCと推定トピックを組み合わせても性能向上が見られなかったが、LIWC+訓練済みトピックの組み合わせは、トピック数が多い場合にわずかな向上が見られた。
- 推定トピックは、全データセットの再訓練が不要であるため、訓練済みトピックよりも再利用性が高かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。