Skip to main content
QUICK REVIEW

[论文解读] Tending Unmarked Graves: Classification of Post-mortem Content on Social Media

Jialun Aaron Jiang, Jed R. Brubaker|arXiv (Cornell University)|Mar 22, 2019
Mental Health via Writing参考文献 39被引用 4
一句话总结

本文提出机器学习分类器,利用语言特征自动检测社交媒体中的逝者内容,包括已纪念的用户资料和单条评论。模型在870,326条MySpace评论上进行训练,能高准确率地在用户去世后迅速识别出已故用户,并在Facebook纪念群组和讣告中具有良好泛化能力,有助于实现更具同理心的平台设计,并提升数据科学在考虑死亡因素后的准确性。

ABSTRACT

User-generated content is central to social computing scholarship. However, researchers and practitioners often presume that these users are alive. Failing to account for mortality is problematic in social media where an increasing number of profiles represent those who have died. Identifying mortality can empower designers to better manage content and support the bereaved, as well as promote high-quality data science. Based on a computational linguistic analysis of post-mortem social media profiles and content, we report on classifiers developed to detect mortality and show that mortality can be determined after the first few occurrences of post-mortem content. Applying our classifiers to content from two other platforms also provided good results. Finally, we discuss trade-offs between models that emphasize pre- vs. post-mortem precision in this sensitive context. These results mark a first step toward identifying mortality at scale, and show how designers and scientists can attend to mortality in their work.

研究动机与目标

  • 解决社交媒体中缺乏自动识别已故用户及纪念内容方法的问题。
  • 减少对幸存者手动报告的依赖,以避免其耗时、不一致且情绪负担重。
  • 使平台设计者与数据科学家能够在系统设计与纵向研究中考虑死亡因素。
  • 开发高准确率的分类器,以同时检测逝者资料与单条纪念性评论。
  • 探讨在敏感情境下,预死亡与后死亡精确度之间的伦理权衡。

提出的方法

  • 在2,688个公开的MySpace用户资料(共870,326条评论)上,使用监督式机器学习分类器(如SVM、逻辑回归)进行训练。
  • 采用三类特征集:词汇特征、句法特征与语义特征(包括BERT嵌入),以捕捉后死亡内容的语言标记。
  • 利用这些特征在用户层面分类资料,在单条信息层面分类评论。
  • 通过保留数据集与跨平台测试集上的精确率、召回率与F1分数评估模型性能。
  • 将训练好的模型应用于两个外部数据集:Facebook纪念群组与报纸讣告,以测试其泛化能力。
  • 通过分析与后死亡内容相关的关键词语特征(如对死亡的提及、悲伤表达、过去时叙事)来探索模型可解释性。

实验结果

研究问题

  • RQ1机器学习模型能否基于语言内容准确分类社交媒体资料为后死亡状态?
  • RQ2即使脱离用户资料,单条评论是否也能可靠分类为纪念内容?
  • RQ3在用户去世后多久,可通过早期评论模式检测到后死亡资料?
  • RQ4这些分类器在不同平台(如MySpace、Facebook、讣告)与内容类型之间是否具有良好泛化能力?
  • RQ5在此敏感领域中,最大化预死亡与后死亡精确度之间的伦理权衡是什么?

主要发现

  • 分类器在MySpace数据集上对后死亡资料与评论的检测准确率极高,F1分数超过0.85。
  • 仅需少数几条消息即可可靠检测到后死亡内容,表明早期检测是可行的。
  • 模型在Facebook纪念群组与报纸讣告中表现出良好泛化能力,证明其跨平台稳健性。
  • 如过去时态引用、悲伤表达与第三人称叙事等语言特征,是后死亡内容的强指标。
  • 强调后死亡精确度的模型优于优先考虑预死亡准确度的模型,尤其在减少对活用户误报方面表现更优。
  • 本研究指出,即使采用保守的标签如“可能为后死亡”,也能为更具同理心的设计提供依据,且不会造成不可逆后果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。