[论文解读] Smart City Analytics: Ensemble-Learned Prediction of Citizen Home Care
本文提出一种集成学习方法,用于预测哥本哈根市民大增的居家护理时长,使用基于历史数据训练的线性(逻辑回归)或非线性(随机森林)模型。该方法在仅使用有限训练数据的情况下,实现了最先进的AUC 0.715,表现出色,并识别出近期护理模式为最具预测力的特征。
We present an ensemble learning method that predicts large increases in the hours of home care received by citizens. The method is supervised, and uses different ensembles of either linear (logistic regression) or non-linear (random forests) classifiers. Experiments with data available from 2013 to 2017 for every citizen in Copenhagen receiving home care (27,775 citizens) show that prediction can achieve state of the art performance as reported in similar health related domains (AUC=0.715). We further find that competitive results can be obtained by using limited information for training, which is very useful when full records are not accessible or available. Smart city analytics does not necessarily require full city records. To our knowledge this preliminary study is the first to predict large increases in home care for smart city analytics.
研究动机与目标
- 使用智慧城市数据开发一个预测公民居家护理时长大幅增加的预测模型。
- 评估集成学习方法在预测长期居家护理需求方面的性能。
- 评估不同数据可用性水平对模型准确率的影响。
- 识别居家护理升级的最具预测力特征。
- 证明使用有限且低成本数据进行有效智慧城市健康分析的可行性。
提出的方法
- 该方法将居家护理预测问题建模为二分类问题:预测某位市民在未来3个月内居家护理时长是否增加6小时以上。
- 采用两级集成学习架构:第0层模型(逻辑回归或随机森林)在序列数据块上进行训练,其预测结果通过第1层元模型进行融合。
- 第0层模型每月重新训练一次,使用上月数据(IL1)或所有先前数据(IL2),形成动态集成。
- 最终预测通过将第0层模型的输出组合成元实例向量,再由第1层模型进行分类生成。
- 使用正则化逻辑回归和随机森林分类器作为基学习器,通过超参数调优以实现最佳性能。
- 使用AUC评估性能,并在五个信息水平(IL1–IL4)进行消融研究,以评估数据效率。
实验结果
研究问题
- RQ1集成学习能否在智慧城市背景下有效预测个体市民居家护理时长的大幅增加?
- RQ2当训练数据仅限于最近或最少信息时,模型性能如何变化?
- RQ3哪些特征最能预测居家护理需求的显著增加?
- RQ4所提方法与基于历史模式的启发式基线相比表现如何?
- RQ5服务接收的二元指标在多大程度上可替代详细临床数据以实现准确预测?
主要发现
- 当使用所有可用历史数据训练时,集成模型实现了0.715的AUC,优于两种启发式基线(AUC分别为0.548和0.634)。
- 表现最佳的模型使用了所有先前数据进行训练,表明长期历史模式对准确预测至关重要。
- 过去3个月内先前大增的居家护理次数是预测力最强的特征,权重为0.38。
- 其他关键特征包括住院史(0.22)、病假护理接收(0.21)、周末居家护理(0.21)以及年龄(0.14)。
- 仅使用服务接收的二元指标(IL2b)即可获得与完整数据相当的性能,表明低成本数据具有高度有效性。
- 模型在不同信息水平下表现稳定,当使用综合数据时AUC始终高于0.710,表明对数据稀疏性具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。