[论文解读] An evaluation of randomized machine learning methods for redundant data: Predicting short and medium-term suicide risk from administrative records and risk assessments
本研究评估了随机化机器学习方法——随机森林、梯度提升机以及带有Dropout的深度神经网络——在7,399名精神卫生患者的管理数据和临床数据上预测短期和中期自杀风险的表现。随机化方法在AUC和F1-score上均优于临床医生和传统模型,展现出对数据冗余的鲁棒性以及更优的预测准确性。
Accurate prediction of suicide risk in mental health patients remains an open problem. Existing methods including clinician judgments have acceptable sensitivity, but yield many false positives. Exploiting administrative data has a great potential, but the data has high dimensionality and redundancies in the recording processes. We investigate the efficacy of three most effective randomized machine learning techniques random forests, gradient boosting machines, and deep neural nets with dropout in predicting suicide risk. Using a cohort of mental health patients from a regional Australian hospital, we compare the predictive performance with popular traditional approaches clinician judgments based on a checklist, sparse logistic regression and decision trees. The randomized methods demonstrated robustness against data redundancies and superior predictive performance on AUC and F-measure.
研究动机与目标
- 解决使用高维且冗余的管理与临床数据预测精神卫生患者自杀风险的挑战。
- 评估随机化机器学习技术是否能相较于传统方法和临床医生评估提升预测性能。
- 探究随机化模型在电子病历中常见的数据冗余情况下的鲁棒性。
- 将随机森林、梯度提升机和带有Dropout的深度神经网络与稀疏逻辑回归、决策树及临床医生清单的预测性能进行比较。
- 在多个预测时间范围(15至360天)内验证这些方法的有效性。
提出的方法
- 采用包含25棵树的随机森林,每次分裂时使用√p个特征子集,并将最小叶节点大小设为n/64。
- 应用包含200个弱学习器的梯度提升机,采用50%的数据子采样,随机特征子集大小为min(p/3, √n),并使用动态学习率。
- 使用包含两层各50个神经元的深度神经网络,采用小批量大小为64的随机梯度下降,并应用自适应学习率衰减。
- 整合多种正则化技术:权重衰减(10⁻⁴)、最大范数约束(值为1),以及在隐藏单元和输入特征上使用0.5的Dropout率。
- 在训练过程中通过以0.5的概率随机关闭单元来应用Dropout,并在推理阶段通过Dropout率对权重进行缩放,以近似模型平均。
- 对电子病历派生的预测变量进行标准化,以确保在类似电子健康记录系统中的可推广性。
实验结果
研究问题
- RQ1与临床医生判断和传统统计模型相比,随机化机器学习方法是否能提升自杀风险预测的准确性?
- RQ2在冗余的高维精神卫生数据上,随机森林、梯度提升机和带有Dropout的深度神经网络在AUC和F1-score上的表现如何?
- RQ3这些随机化模型在电子病历中面对数据冗余和高维性时,其鲁棒性达到何种程度?
- RQ4在输入层和隐藏层同时引入Dropout是否能增强泛化能力并减少过拟合?
- RQ5所提出模型在不同预测时间范围(15至360天)内的预测性能如何变化?
主要发现
- 随机化机器学习方法在AUC和F1-score上显著优于使用18分 checklist 的临床医生。
- 在所有预测时间范围内,随机森林、梯度提升机和带有Dropout的深度神经网络在AUC和F1度量上均优于稀疏逻辑回归和决策树。
- 带有Dropout的深度神经网络表现出色,尤其得益于在特征和隐藏单元层面的正则化。
- 这些模型对数据冗余表现出鲁棒性,能够保留有用信息而无需丢弃特征,与Lasso类方法不同。
- 从15天到360天的所有时间范围内,预测性能保持稳定,且随机化模型始终表现更优。
- 在输入层使用Dropout对于减轻电子病历数据中冗余特征的影响至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。