[论文解读] Perfecting the Crime Machine
本文提出了一种新颖的混合机器学习工作流程,结合无监督聚类与有监督分类,利用时空特征预测费城的多类别犯罪类型。通过将聚类距离作为输入特征并使用随机森林进行优化,该模型实现了 2.3120 的对数损失,优于其他模型,并且无需基于网格的空间划分即可实现跨城市的泛化。
This study explores using different machine learning techniques and workflows to predict crime related statistics, specifically crime type in Philadelphia. We use crime location and time as main features, extract different features from the two features that our raw data has, and build models that would work with large number of class labels. We use different techniques to extract various features including combining unsupervised learning techniques and try to predict the crime type. Some of the models that we use are Support Vector Machines, Decision Trees, Random Forest, K-Nearest Neighbors. We report that the Random Forest as the best performing model to predict crime type with an error log loss of 2.3120.
研究动机与目标
- 开发一种可扩展的、无城市依赖的犯罪预测框架,避免基于网格的空间划分。
- 通过将无监督聚类与有监督学习相结合,提升多类别犯罪类型预测的性能。
- 识别对犯罪分类最具预测力的时空特征。
- 在高类别标签条件下(30 个类别)系统地评估并比较多种有监督模型。
- 通过使用聚类中心作为参考点,减少对城市特定预处理的依赖。
提出的方法
- 使用无监督技术每年对犯罪地点进行聚类,以定义空间热点区域。
- 计算每个犯罪点到最近聚类中心的欧几里得距离,作为新特征。
- 从时间戳中提取时间特征,如小时、分钟、星期几和月份。
- 通过旋转坐标(Rot30X、Rot45X、Rot60X)进行特征工程,以捕捉方向性模式。
- 训练并调优多种有监督模型:随机森林、支持向量机、K-最近邻、决策树、朴素贝叶斯、逻辑回归和多层感知机。
- 通过概率平滑和超参数调优,使用对数损失优化模型性能。
实验结果
研究问题
- RQ1对犯罪地点进行无监督聚类是否能提升有监督犯罪类型分类模型的性能?
- RQ2将到聚类中心的距离作为特征,与传统的基于网格的空间分箱相比,在犯罪预测中表现如何?
- RQ3哪些时空特征组合能为多类别犯罪类型预测提供最高的预测准确率?
- RQ4在高基数类别标签(30 种犯罪类型)条件下,不同有监督学习模型的表现如何?
- RQ5所提出的流程在无需城市特定预处理的情况下,能在多大程度上实现跨城市的泛化?
主要发现
- 随机森林实现了最低的对数损失 2.3120,优于所有其他模型,包括支持向量机和 K-最近邻。
- 表现最佳的模型在平滑参数为 0.000170 时,对数损失达到 2.281062,表明概率校准得到改善。
- 特征重要性分析显示,小时(Hour)、小时区域(Hour Zone)、Y 坐标和 Rot60X 是预测中最具影响力的特征。
- 模型准确率为 0.218282,尽管较低,但反映了在 30 个不同标签下进行多类别犯罪预测的挑战。
- 误预测率最高的犯罪类型为第 20 类(92,597 次误预测)和第 30 类(49,930 次误预测),其平均对数损失分别为 2.5779 和 2.1085。
- 该工作流程成功降低了对城市特定空间网格的依赖,通过基于聚类的特征工程,实现了向其他城市区域的泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。