[论文解读] Natural Language Processing Methods to Identify Oncology Patients at High Risk for Acute Care with Clinical Notes
本研究评估了自然语言处理(NLP)方法在使用非结构化临床记录预测肿瘤科患者急性医疗使用(ACU)方面的表现,比较了传统NLP特征工程与深度学习模型的性能。研究发现,采用人工设计语言特征的$ε_{1}$-惩罚逻辑回归模型(语言LASSO)的C统计量为0.730,优于基于BERT的模型(0.702),且与基于结构化医疗数据的模型(0.748)相当,表明该方法在跨机构、低预处理需求的肿瘤科风险预测中具有强大潜力。
Clinical notes are an essential component of a health record. This paper evaluates how natural language processing (NLP) can be used to identify the risk of acute care use (ACU) in oncology patients, once chemotherapy starts. Risk prediction using structured health data (SHD) is now standard, but predictions using free-text formats are complex. This paper explores the use of free-text notes for the prediction of ACU instead of SHD. Deep Learning models were compared to manually engineered language features. Results show that SHD models minimally outperform NLP models; an l1-penalised logistic regression with SHD achieved a C-statistic of 0.748 (95%-CI: 0.735, 0.762), while the same model with language features achieved 0.730 (95%-CI: 0.717, 0.745) and a transformer-based model achieved 0.702 (95%-CI: 0.688, 0.717). This paper shows how language models can be used in clinical applications and underlines how risk bias is different for diverse patient groups, even using only free-text data.
研究动机与目标
- 评估是否可通过非结构化临床记录的NLP分析,预测化疗开始后肿瘤科患者的急性医疗使用(ACU)风险,作为结构化医疗数据(SHD)的替代方案。
- 比较传统NLP特征工程与基于Transformer的深度学习模型(如BERT)在ACU风险预测中的性能表现。
- 评估将临床记录与SHD结合是否能显著提升预测性能,优于单独使用任一模态。
- 调查仅使用自由文本数据时,模型可解释性及在不同患者亚组中潜在的风险偏差问题。
提出的方法
- 从单一学术癌症中心的电子健康记录系统(Epic Systems)中收集并预处理临床记录(入院及出院记录及病程记录),排除字数少于100或超过5,000字的记录,以及包含临床试验知情同意书的记录。
- 为每位患者提取并聚合化疗开始前180天内的最新三条记录。
- 使用spaCy生成人工设计的语言特征,包括实体移除、否定标注、词形还原,以及对前2,000个最常见词汇进行TF-IDF加权。
- 在结构化医疗数据(760个特征)和语言特征(语言LASSO)上分别训练$ε_{1}$-惩罚逻辑回归模型(LASSO),并联合两种模态(融合LASSO)。
- 在完整临床文本上训练基于BERT的Transformer模型用于ACU预测,采用嵌套有序回归方法,联合预测30日、180日和365日的风险。
- 使用先前研究中固定的训练/测试划分进行模型验证,通过C统计量和AUROC报告性能表现,并绘制校准图,同时对亚组偏差进行敏感性分析。
实验结果
研究问题
- RQ1非结构化临床记录的NLP分析能否在预测肿瘤科患者ACU方面达到或优于基于结构化医疗数据(SHD)的模型?
- RQ2基于深度学习的Transformer模型(如BERT)是否在从临床记录预测ACU方面优于使用线性模型的传统NLP特征工程?
- RQ3将临床记录与SHD结合是否能显著提升ACU预测性能,优于单独使用任一模态?
- RQ4LASSO-based NLP模型是否能提供可解释的风险预测洞察,而不同于黑箱Transformer模型?
- RQ5在仅使用自由文本数据而未显式引入人口学信息的情况下,是否可检测到患者亚组间风险预测偏差?
主要发现
- 使用结构化医疗数据的$ε_{1}$-惩罚逻辑回归模型(表格LASSO)的C统计量为0.748(95%置信区间:0.735–0.762),略优于使用人工设计语言特征的LASSO模型(C统计量:0.730;95%置信区间:0.717–0.745)。
- 基于BERT的模型C统计量为0.702(95%置信区间:0.688–0.717),表现低于两种LASSO模型,表明在碎片化临床文本片段上训练深度模型存在挑战。
- 语言LASSO在所有时间区间均实现AUROC ≥ 0.700,即使在无结构化数据支持下也展现出强大的判别性能,尤其在180天预测中表现突出。
- 融合SHD与语言特征的模型在性能上未显著优于单独使用SHD,表明在此设置下联合模态的附加价值有限。
- 敏感性分析显示,尽管未使用任何人口学特征,仍可能在患者亚组中存在潜在风险偏差,提示在模型部署时需保持谨慎。
- 本研究证明,LASSO-based NLP模型可通过特征系数提供可解释性,而BERT则缺乏此类透明的可解释机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。