[论文解读] Using Linguistic Features to Estimate Suicide Probability of Chinese Microblog Users
本研究提出一种机器学习方法,利用来自新浪微博的文本特征预测中国微博用户的自杀风险概率。通过对1,041名用户的微博内容应用LIWC和基于LDA的主题建模,作者发现推断出的主题优于LIWC特征,最佳均方根误差(RMSE)达到11.68;推断主题在预测性能上与训练主题相当或更优,且具有更高的可重用性。
If people with high risk of suicide can be identified through social media like microblog, it is possible to implement an active intervention system to save their lives. Based on this motivation, the current study administered the Suicide Probability Scale(SPS) to 1041 weibo users at Sina Weibo, which is a leading microblog service provider in China. Two NLP (Natural Language Processing) methods, the Chinese edition of Linguistic Inquiry and Word Count (LIWC) lexicon and Latent Dirichlet Allocation (LDA), are used to extract linguistic features from the Sina Weibo data. We trained predicting models by machine learning algorithm based on these two types of features, to estimate suicide probability based on linguistic features. The experiment results indicate that LDA can find topics that relate to suicide probability, and improve the performance of prediction. Our study adds value in prediction of suicidal probability of social network users with their behaviors.
研究动机与目标
- 开发一种可扩展的、主动的自杀风险检测系统,利用社交媒体数据。
- 探究微博中的语言特征是否能以高精度预测自杀意念。
- 比较基于LIWC的特征与使用LDA的主题建模在预测性能上的差异。
- 评估从高风险用户群体中推断出的主题与在全数据集上训练的主题在预测能力上的差异。
- 探索推断主题在心理健康风险预测中的可重用性和泛化潜力。
提出的方法
- 收集了1,041名用户的新浪微博内容和SPS评分,构建了一个带标签的数据集。
- 应用中文版LIWC提取与情绪和认知状态相关的词汇特征。
- 使用潜在狄利克雷分布(LDA)从微博文本中提取主题特征。
- 使用LIWC特征、训练主题和推断主题,通过有监督的机器学习模型(逐步线性回归)进行训练。
- 通过RMSE作为指标,比较不同特征组合与主题数量下的模型性能。
- 评估了基于全数据集训练的主题(训练主题)与从高风险子群中推断的主题(推断主题)在预测能力与可重用性方面的表现。
实验结果
研究问题
- RQ1中文微博文本的语言特征是否能以可接受的精度预测自杀风险概率?
- RQ2基于LDA推导出的主题模型是否在预测自杀意念方面优于传统的词汇分析(LIWC)?
- RQ3在全数据集上训练的主题与从高风险子群中推断的主题之间,预测性能是否存在显著差异?
- RQ4是否可以通过小规模高风险子集训练的推断主题,实现与训练主题相当或更优的性能?
- RQ5结合LIWC与主题特征是否能提高预测准确率?若能,其适用条件是什么?
主要发现
- 表现最佳的模型使用70个主题的推断主题,RMSE达到11.68,显著优于LIWC基线(RMSE = 15.43)。
- 与LIWC相比,基于LDA的主题建模提升了预测准确率,证实主题特征能捕捉比词汇计数更细微的心理信号。
- 推断主题在预测能力上与训练主题相当或更优,尤其在主题数量较多时表现更稳定。
- 单个主题与SPS评分之间的最大相关系数达到0.15,主题数量超过70–100个后无显著提升,表明收益递减。
- 结合LIWC与推断主题并未提升性能,而LIWC+训练主题仅在主题数量较高时表现出微弱增益。
- 推断主题比训练主题更具可重用性,因其无需在全数据集上重新训练即可应用于新数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。