Skip to main content
QUICK REVIEW

[论文解读] Data Quality Matters: Suicide Intention Detection on Social Media Posts Using RoBERTa-CNN

Emily Lın, Jian Sun|arXiv (Cornell University)|Feb 3, 2024
Mental Health via WritingPsychology被引用 3
一句话总结

该论文提出了一种 RoBERTa-CNN 模型用于社交媒体帖子中的自杀意图检测(SID),结合 RoBERTa 的上下文理解能力与 CNN 的局部模式提取能力,在自杀与抑郁检测(SDD)数据集上实现了 98% 的平均准确率和超过 97.5% 的 AUC。研究强调了数据质量作为关键因素,通过基于 GPT 的清洗方法提升了模型性能。

ABSTRACT

Suicide remains a pressing global health concern, necessitating innovative approaches for early detection and intervention. This paper focuses on identifying suicidal intentions in posts from the SuicideWatch subreddit by proposing a novel deep-learning approach that utilizes the state-of-the-art RoBERTa-CNN model. The robustly Optimized BERT Pretraining Approach (RoBERTa) excels at capturing textual nuances and forming semantic relationships within the text. The remaining Convolutional Neural Network (CNN) head enhances RoBERTa's capacity to discern critical patterns from extensive datasets. To evaluate RoBERTa-CNN, we conducted experiments on the Suicide and Depression Detection dataset, yielding promising results. For instance, RoBERTa-CNN achieves a mean accuracy of 98% with a standard deviation (STD) of 0.0009. Additionally, we found that data quality significantly impacts the training of a robust model. To improve data quality, we removed noise from the text data while preserving its contextual content through either manually cleaning or utilizing the OpenAI API.

研究动机与目标

  • 开发一种用于通过社交媒体文本进行早期自杀意图检测的稳健 NLP 模型。
  • 通过将 RoBERTa 与 CNN 头部结合,改进现有方法以增强模式识别能力。
  • 研究数据质量对自杀检测任务中模型性能的影响。
  • 识别最优超参数,特别是序列长度(Max_Len),以在 SDD 数据集上实现最佳性能。
  • 展示基于 GPT 的数据清洗在提升模型泛化能力和准确率方面的有效性。

提出的方法

  • 微调 RoBERTa 作为上下文编码器,以捕捉文本中的语义和句法关系。
  • 添加卷积神经网络(CNN)头部,以提取局部语言模式并增强特征学习。
  • 采用五折交叉验证的共轭学习设置,以确保评估的客观性和可复现性。
  • 通过消融研究在 64、128 和 256 个标记的序列长度之间优化输入序列长度(Max_Len),以找到最佳性能。
  • 使用 GPT API 清洗和预处理 SDD 数据集,以在训练前提升数据质量。
  • 使用标准 NLP 指标(准确率、精确率、召回率、F1 分数和 AUC)训练并评估 RoBERTa-CNN 模型。

实验结果

研究问题

  • RQ1RoBERTa-CNN 模型是否能在社交媒体文本的自杀意图检测中超越现有最先进模型?
  • RQ2数据质量如何影响深度学习模型在自杀检测任务中的性能?
  • RQ3RoBERTa-CNN 模型在 SDD 数据集上的最优输入序列长度(Max_Len)是多少?
  • RQ4基于 GPT 的数据清洗在多大程度上提升了自杀意图检测中模型的鲁棒性和准确率?
  • RQ5将 CNN 与 RoBERTa 集成如何增强模型识别自杀文本中细微语言线索的能力?

主要发现

  • RoBERTa-CNN 模型在 SDD 数据集上实现了 98.00% ± 0.09% 的平均测试准确率,标准差仅为 0.0009。
  • 该模型在测试集上达到了 97.63% ± 0.13% 的平均 AUC,表明其具有出色的判别性能。
  • 消融研究显示,当 Max_Len = 256 时,模型在测试集上达到最高准确率(98.00%)和最稳定的精确率。
  • 数据质量被确定为关键因素,基于 GPT 的清洗显著提升了模型性能。
  • RoBERTa-CNN 在同一数据集上优于竞争性模型,如 CNN-BiLSTM 和 XGBoost。
  • 该模型在各项指标上表现出强鲁棒性,测试集上的 F1 分数为 96.81% ± 0.14%,召回率为 96.64% ± 0.30%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。