[论文解读] A Quantitative and Qualitative Analysis of Suicide Ideation Detection using Deep Learning
本研究在多个自杀意念检测数据集上复现并评估了前沿的深度学习模型——RNN、CNN 和基于注意力机制的网络,采用多种输入嵌入方式和预训练语言模型。研究发现,模型性能在很大程度上取决于数据集质量,其中 RoBERTa 等预训练模型在更大、更具上下文信息的数据集上显著优于传统架构,凸显了数据质量与上下文理解在社交媒体文本自杀风险检测中的关键作用。
For preventing youth suicide, social media platforms have received much attention from researchers. A few researches apply machine learning, or deep learning-based text classification approaches to classify social media posts containing suicidality risk. This paper replicated competitive social media-based suicidality detection/prediction models. We evaluated the feasibility of detecting suicidal ideation using multiple datasets and different state-of-the-art deep learning models, RNN-, CNN-, and Attention-based models. Using two suicidality evaluation datasets, we evaluated 28 combinations of 7 input embeddings with 4 commonly used deep learning models and 5 pretrained language models in quantitative and qualitative ways. Our replication study confirms that deep learning works well for social media-based suicidality detection in general, but it highly depends on the dataset's quality.
研究动机与目标
- 为解决社交媒体中自杀意念检测模型缺乏可复现性和泛化能力的问题,复现了具有竞争力的现有方法。
- 在多个公开的自杀意念检测数据集上,评估多样化深度学习模型(RNN、CNN 和基于注意力机制的网络)的性能。
- 通过仅使用文本嵌入与其它多模态或特征融合方法的对比,隔离文本特征的影响。
- 通过发布完整代码和详细的超参数配置,促进研究透明度,以支持复现与进一步开发。
- 对嵌入类型、深度学习架构以及预训练语言模型在自杀意念检测任务中的表现进行全面比较分析。
提出的方法
- 本研究使用两个不同的自杀意念检测数据集:基于关键词匹配和帖子级别标注的自杀相关推文数据集,以及基于用户级别风险标签(非帖子级别)的 UMD Reddit 自杀意念数据集。
- 评估了 7 种输入嵌入(如词嵌入、字符嵌入、文档嵌入及混合嵌入)与 4 种传统深度学习模型(双向LSTM、CNN、GRU 和基于注意力机制的模型)的 28 种组合。
- 进一步在两个数据集上评估了 5 种预训练语言模型(包括 BERT 和 RoBERTa),以比较其相对于基线模型和传统架构的性能表现。
- 评估采用标准分类指标(准确率、F1 值、AUC),并包含基于 softmax 层概率热力图的定性案例研究,以解释模型预测结果。
- 采用五折交叉验证和 80-20 训练-测试划分,对 UMD Reddit 数据集采用比例采样以保持标签分布的稳定性。
- 本研究强调可复现性,发布了所有实验的完整代码和详细的超参数设置。
实验结果
研究问题
- RQ1在多个数据集上,不同深度学习架构(RNN、CNN、基于注意力机制的模型)在自杀意念检测中的表现如何?
- RQ2各种输入嵌入(如词嵌入、字符嵌入、文档嵌入及混合嵌入)对自杀意念检测中模型性能的影响是什么?
- RQ3预训练语言模型(如 BERT 和 RoBERTa)与传统深度学习模型及基线分类器相比,在检测自杀意念方面表现如何?
- RQ4数据集质量与标注策略(帖子级别 vs. 用户级别)在多大程度上影响模型性能与泛化能力?
- RQ5对预测概率的定性分析能否揭示模型在模糊或依赖上下文的案例中的推理模式?
主要发现
- 在自杀相关推文数据集中,结合字符+文档嵌入的基于注意力机制的模型取得了最高准确率,而传统模型在不同嵌入类型下的表现模式保持一致。
- 在 UMD Reddit 自杀意念数据集中,RoBERTa 表现优于所有其他模型,准确率在 45% 至 60% 之间,显著超越基线模型。
- 传统深度学习模型(如 Bi-LSTM、CNN)的性能高度依赖于嵌入类型,其中文档嵌入导致最低准确率,而混合嵌入取得最高准确率。
- 基线模型(旋转森林和 SVM)在 Reddit 数据集上表现较差,尤其当自杀相关关键词出现在非临床语境中时,例如 'dead' 出现在 'keg of Franziskaner is dead' 这类表达中。
- RoBERTa 能够在包含 'dead' 一词的情况下正确将某条帖子分类为 '无风险',展示了其利用上下文理解的能力,而简单模型则不具备此能力。
- 本研究证实,只有在拥有足够且高质量的数据,特别是目标类别数据充足时,深度学习模型才能有效用于自杀意念检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。