[论文解读] Suicide Phenotyping from Clinical Notes in Safety-Net Psychiatric Hospital Using Multi-Label Classification with Pre-Trained Language Models
本研究基于一家安全网精神科医院的临床病历,利用基于 BERT 的模型开发了一套多标签自杀表型识别系统。通过单个多标签分类进行微调的 RoBERTa 模型取得了最佳性能(准确率:0.88,F1 值:0.81),表明领域特定预训练和多标签策略能显著提升对共现自杀事件(如自杀意念、自杀未遂、接触自杀、非自杀性自伤)的检测效果。
Accurate identification and categorization of suicidal events can yield better suicide precautions, reducing operational burden, and improving care quality in high-acuity psychiatric settings. Pre-trained language models offer promise for identifying suicidality from unstructured clinical narratives. We evaluated the performance of four BERT-based models using two fine-tuning strategies (multiple single-label and single multi-label) for detecting coexisting suicidal events from 500 annotated psychiatric evaluation notes. The notes were labeled for suicidal ideation (SI), suicide attempts (SA), exposure to suicide (ES), and non-suicidal self-injury (NSSI). RoBERTa outperformed other models using binary relevance (acc=0.86, F1=0.78). MentalBERT (F1=0.74) also exceeded BioClinicalBERT (F1=0.72). RoBERTa fine-tuned with a single multi-label classifier further improved performance (acc=0.88, F1=0.81), highlighting that models pre-trained on domain-relevant data and the single multi-label classification strategy enhance efficiency and performance.
研究动机与目标
- 通过从非结构化临床病历中提取自杀事件,提升高危精神科环境中的自杀风险检测能力。
- 评估预训练语言模型在识别共现自杀表型(自杀意念(SI)、自杀未遂(SA)、接触自杀(ES)、非自杀性自伤(NSSI))方面的有效性。
- 比较多种微调策略——多标签单分类与单多标签分类——在临床叙述文本中的自杀表型识别表现。
- 评估模型架构与领域特定预训练对表型识别性能的影响。
- 通过自动化、高精度的自杀风险表型识别,支持临床决策并减轻操作负担。
提出的方法
- 在 500 份标注的精神科评估病历上微调四种基于 BERT 的模型——BERT、BioClinicalBERT、MentalBERT 和 RoBERTa。
- 应用两种微调策略:多标签单分类(每类自杀事件类型对应一个模型)与单多标签分类(一个模型同时预测全部四个标签)。
- 使用来自安全网精神科医院的领域相关临床病历,以增强模型在精神健康语境下的泛化能力。
- 采用标准 NLP 指标——准确率与 F1 值——对所有四种自杀事件类型进行评估。
- 通过超参数调优和 Transformer 架构中注意力机制的利用,优化模型性能。
- 利用迁移学习,将预训练语言模型适配至低资源、高风险的自杀表型识别领域。
实验结果
研究问题
- RQ1预训练语言模型能否有效从精神科住院环境中非结构化的临床病历中检测出多种共现的自杀事件?
- RQ2模型架构的选择(如 RoBERTa 与 BERT)如何影响自杀表型识别任务的性能?
- RQ3单多标签分类是否优于多标签单分类,在检测多样化自杀表型方面?
- RQ4与通用领域模型相比,领域特定预训练在多大程度上提升了自杀表型识别性能?
- RQ5不同微调策略在多大程度上影响自杀事件检测的准确率与 F1 值?
主要发现
- 使用单多标签分类策略的 RoBERTa 表现最佳,准确率为 0.88,F1 值为 0.81。
- 在多标签单分类设置中,RoBERTa 同样表现优异,准确率达 0.86,F1 值为 0.78。
- MentalBERT 表现强劲(准确率 0.83,F1 值 0.74),优于 BioClinicalBERT(准确率 0.82,F1 值 0.72)。
- BioClinicalBERT 超过基础 BERT 模型(准确率 0.80,F1 值 0.70),表明领域特定预训练具有显著优势。
- 单多标签微调策略优于多标签单分类策略,表明其在学习标签相关性方面更具优势。
- 模型优化、领域相关预训练与多标签微调共同提升了自杀表型识别的整体性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。