Skip to main content
QUICK REVIEW

[论文解读] Towards Preemptive Detection of Depression and Anxiety in Twitter

David Owen, José Camacho-Collados|arXiv (Cornell University)|Nov 10, 2020
Mental Health via Writing参考文献 20被引用 12
一句话总结

本文提出了DATD,一个基于Twitter的抑郁症与焦虑症检测数据集,通过二元微博分类进行检测,并评估了最先进的语言模型(如BERT、ALBERT)与传统分类器(如TF-IDF和词嵌入的SVM)。结果表明,预训练语言模型在平衡数据上表现优于传统方法,但在类别不平衡及反直觉语言线索下性能差距显现,凸显了在心理健康检测系统中提升上下文理解能力的必要性。

ABSTRACT

Depression and anxiety are psychiatric disorders that are observed in many areas of everyday life. For example, these disorders manifest themselves somewhat frequently in texts written by nondiagnosed users in social media. However, detecting users with these conditions is not a straightforward task as they may not explicitly talk about their mental state, and if they do, contextual cues such as immediacy must be taken into account. When available, linguistic flags pointing to probable anxiety or depression could be used by medical experts to write better guidelines and treatments. In this paper, we develop a dataset designed to foster research in depression and anxiety detection in Twitter, framing the detection task as a binary tweet classification problem. We then apply state-of-the-art classification models to this dataset, providing a competitive set of baselines alongside qualitative error analysis. Our results show that language models perform reasonably well, and better than more traditional baselines. Nonetheless, there is clear room for improvement, particularly with unbalanced training sets and in cases where seemingly obvious linguistic cues (keywords) are used counter-intuitively.

研究动机与目标

  • 开发一个高质量、公开可用的数据集(DATD),用于检测Twitter帖子中的抑郁症与焦虑症。
  • 评估最先进的预训练语言模型(如BERT、ALBERT)和传统机器学习模型(如TF-IDF和词嵌入的SVM)在此检测任务上的表现。
  • 识别当前模型的局限性,特别是关于类别不平衡和反直觉语言线索的使用。
  • 提供对模型失败的定性洞察,以指导未来心理健康检测系统的发展。

提出的方法

  • 使用Twitter的Stream API从2018年5月到2019年8月收集了120万条英文微博。
  • 通过专家对1,000条微博进行标注构建DATD数据集,将其标记为表示抑郁症/焦虑症(1)或否(0),标注者间一致性通过Fleiss’ kappa = 0.63测量。
  • 将TF-IDF特征与预训练词嵌入(GloVe)结合,并应用于SVM分类器,包括有无预处理的两种情况。
  • 在DATD数据集上微调BERT和ALBERT以实现端到端分类,利用其上下文表示,且未在Twitter特定数据上进一步微调。
  • 设计两种实验设置:DATD(原始划分)和DATD+Rand(标签随机打乱),以评估模型鲁棒性。
  • 对误分类的微博进行定性错误分析,识别出逃避检测的语言模式,如反语、隐喻或正面词汇的非字面用法。

实验结果

研究问题

  • RQ1预训练语言模型(如BERT和ALBERT)与传统分类器(如TF-IDF和词嵌入的SVM)在检测Twitter微博中的抑郁症与焦虑症方面表现如何?
  • RQ2训练数据中的类别不平衡在多大程度上影响不同分类模型的性能?
  • RQ3哪些语言模式——尤其是非字面或反直觉的表达——常导致模型误分类?
  • RQ4为何某些模型在需要世界知识或语义理解的场景下表现优于其他模型?
  • RQ5对误分类样本的定性分析能否揭示当前模型在心理健康检测中系统性局限?

主要发现

  • BERT在DATD数据集上取得了0.737的最高F1分数,优于传统模型,表明其在未针对Twitter数据微调的情况下仍表现出色。
  • ALBERT在DATD+Rand设置中取得了最高的召回率(0.880),表明其在类别不平衡设置下对阳性样本具有更好的敏感性。
  • 结合TF-IDF与词嵌入特征的SVM模型取得了0.750的F1分数,优于仅使用TF-IDF或词嵌入的基线模型。
  • 朴素基线(将所有标签预测为阳性)实现了100%的召回率,但精确率仅为50%,F1分数为0.670,凸显了类别不平衡带来的挑战。
  • 多条包含反语或隐喻表达的微博(如“有个黄色手机壳,希望它能治好我的抑郁”)被所有模型误分类,除BERT和结合混合特征的SVM外,表明需要更深层次的语义理解。
  • 定性分析显示,当语言线索被反直觉使用时(如在负面语境中使用正面词汇),模型常出现失败;只有语言模型能正确理解上下文细微表达,如“看着这些游戏,lol,人肯定很紧张,但这些游戏太棒了”

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。