Skip to main content
QUICK REVIEW

[论文解读] San Francisco Crime Classification

Yehya Abouelnaga|arXiv (Cornell University)|Jul 13, 2016
Crime Patterns and InterventionsSocial Sciences被引用 17
一句话总结

本文提出了一种机器学习方法,利用时间、空间和类别特征预测旧金山的犯罪类别。通过应用主成分分析(PCA)、特征工程(尤其是对地址和小时的处理)以及随机森林等集成方法,作者在Kaggle竞赛中取得了log-loss为2.39031的前18%排名。

ABSTRACT

San Francisco Crime Classification is an online competition administered by Kaggle Inc. The competition aims at predicting the future crimes based on a given set of geographical and time-based features. In this paper, I achieved a an accuracy that ranks at top %18, as of May 19th, 2016. I will explore the data, and explain in details the tools I used to achieve that result.

研究动机与目标

  • 使用公开犯罪数据中的地理空间和时间特征,预测旧金山的犯罪类别。
  • 通过高级特征工程,特别是对稀疏的地址字段进行处理,提升分类性能。
  • 评估并比较多种机器学习模型,包括XGBoost、k-NN、决策树和随机森林。
  • 通过稳健的模型调优和降维技术,在Kaggle旧金山犯罪分类竞赛中取得高排名结果。
  • 探索未来方向,如神经网络和分类器融合,以进一步提升性能。

提出的方法

  • 从'Dates'字段中提取关键的时间特征(小时、星期几、月份),以增强时间模式的检测能力。
  • 从'Address'字段中构建新特征,包括'沿街编号(StreetNo)'和'街区标识(Block)',以提升模型在稀疏地址数据上的泛化能力。
  • 应用主成分分析(PCA),使用3个主成分,以降低维度并减轻过拟合。
  • 评估多种分类器:k-最近邻(k-NN)、XGBoost、决策树、贝叶斯分类器和随机森林,使用log-loss作为评估指标。
  • 通过网格搜索优化超参数,特别调优随机森林中的max_depth和n_estimators以获得最佳性能。
  • 使用分类器融合,并探索高级技术如Counting Learning和神经网络,以实现未来性能提升。

实验结果

研究问题

  • RQ1哪些时间与空间特征与旧金山犯罪类别的相关性最强?
  • RQ2PCA在降低维度的同时,能否有效保留犯罪分类的预测能力?
  • RQ3在该数据集中,k-NN、XGBoost、决策树或随机森林中,哪种机器学习模型的log-loss表现最佳?
  • RQ4对稀疏的'Address'字段进行特征工程,能在多大程度上提升分类准确率?
  • RQ5神经网络或集成方法是否能进一步提升性能,超越传统树基模型?

主要发现

  • 一天中的小时是预测力最强的特征,与犯罪类别的相关性最高。
  • 随机森林模型在max_depth=13和n_estimators=200时,达到最低验证log-loss(2.41057)。
  • 在随机森林模型中加入StreetNo和Block特征后,log-loss降低至2.366175731,性能显著提升。
  • 最终模型在测试集上的log-loss为2.39031,使作者在Kaggle竞赛中位列前18%(共2077份提交,排名第388名)。
  • 决策树表现令人意外地出色,最优性能出现在max_depth=10和n_elements=256时,log-loss为2.50849507。
  • 与集成方法相比,XGBoost和贝叶斯分类器表现较差,XGBoost在max_depth=5时的log-loss为2.57428。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。