[论文解读] Detecting Suicide Risk in Online Counseling Services: A Study in a Low-Resource Language
该论文提出SI-BERT,一种通过临床专家审核的自杀倾向线索词典增强的微调预训练语言模型,用于在希伯来语在线心理咨询对话中实现早期自杀意念检测。集成模型在测试中取得0.91的ROC-AUC与0.55的F2-score,优于强基线模型,即使仅使用20%的文本内容也能实现早期风险识别。
With the increased awareness of situations of mental crisis and their societal impact, online services providing emergency support are becoming commonplace in many countries. Computational models, trained on discussions between help-seekers and providers, can support suicide prevention by identifying at-risk individuals. However, the lack of domain-specific models, especially in low-resource languages, poses a significant challenge for the automatic detection of suicide risk. We propose a model that combines pre-trained language models (PLM) with a fixed set of manually crafted (and clinically approved) set of suicidal cues, followed by a two-stage fine-tuning process. Our model achieves 0.91 ROC-AUC and an F2-score of 0.55, significantly outperforming an array of strong baselines even early on in the conversation, which is critical for real-time detection in the field. Moreover, the model performs well across genders and age groups.
研究动机与目标
- 为低资源、词形丰富的语言(如希伯来语)中自杀风险检测的NLP资源匮乏问题提供解决方案。
- 开发一种计算模型,实现实时基于文本的咨询会话中自杀意念的早期检测。
- 将特定领域的语言知识(通过专家审核的词典)与上下文感知的预训练语言模型相结合,以提升检测性能。
- 确保在不同性别与年龄群体等多样化人群中的稳健性能。
- 构建一个可部署的系统,支持咨询师及时且准确地识别高风险个体。
提出的方法
- 在领域特定的咨询数据上对预训练的希伯来语BERT模型(AlephBERT)进行掩码语言建模任务的微调。
- 通过引入与自杀意念相关的未登录词(OOV)token扩展模型词汇表,以提升覆盖范围。
- 基于人工整理并经临床认可的自杀倾向线索词典,训练一个独立的逻辑回归模型。
- 通过结合微调后的SI-BERT与基于词典的分类器的预测结果,构建集成模型。
- 采用两阶段微调策略:首先在掩码语言建模任务上微调,随后在具有领域特性的数据上进行自杀意念分类微调。
- 使用ROC-AUC、F2-score,以及在不同人口统计特征与文本截断水平下的分析来评估模型性能。
实验结果
研究问题
- RQ1在低资源语言中,经过领域特定咨询数据微调的预训练语言模型,是否能比现有基线模型更早、更准确地检测出自杀意念?
- RQ2将经临床审核的词典与上下文语言模型结合,相比单独使用任一方法,能否显著提升检测性能?
- RQ3该模型在不同人口群体(性别、年龄)及对话早期阶段的性能保持程度如何?
- RQ4在处理否定句、模糊表达或非意念性内容时,模型行为存在哪些定性差异?
- RQ5特定领域的预训练与微调如何影响模型捕捉标准词典未能涵盖的细微自杀表达的能力?
主要发现
- 集成模型取得0.91的ROC-AUC与0.55的F2-score,显著优于强基线模型,包括W2V、前馈神经网络及希伯来语心理词典。
- 当仅处理求助者前20%的发言内容时,模型仍达到82%的ROC-AUC,展现出强大的早期检测能力。
- 模型在不同性别与年龄群体中保持一致的性能表现,表明对人口统计差异具有鲁棒性。
- SI-BERT模型正确将涉及安眠药与消极想法的非意念性语句分类为负面,而标准微调BERT模型则错误地将其分类为正面,凸显了领域特定微调的优势。
- 模型正确识别出典型的自杀意念表达(如‘我觉得生活对我来说太沉重了’),并正确排除了否定句(如‘我不想死’),与临床中意念与意图的区分保持一致。
- 人工构建的词典虽具备高精确率,但召回率与AUC较低,表明上下文建模对捕捉自杀风险的细微表达至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。