[论文解读] Crime Prediction using Machine Learning with a Novel Crime Dataset
本文提出了一项针对孟加拉国的新型、全面的犯罪数据集——涵盖七年内的6,574起犯罪事件,通过从新闻档案、官方数据库和人口普查报告中手动收集数据,整合了时空、天气和人口统计特征。利用特征工程和SMOTE技术,评估了五种监督学习模型(随机森林、XGBoost、AdaBoost、极端梯度提升树、决策树),取得了令人满意的预测性能,从而为孟加拉国及类似背景下的犯罪预测研究奠定了基础资源。
Crime is an unlawful act that carries legal repercussions. Bangladesh has a high crime rate due to poverty, population growth, and many other socio-economic issues. For law enforcement agencies, understanding crime patterns is essential for preventing future criminal activity. For this purpose, these agencies need structured crime database. This paper introduces a novel crime dataset that contains temporal, geographic, weather, and demographic data about 6574 crime incidents of Bangladesh. We manually gather crime news articles of a seven year time span from a daily newspaper archive. We extract basic features from these raw text. Using these basic features, we then consult standard service-providers of geo-location and weather data in order to garner these information related to the collected crime incidents. Furthermore, we collect demographic information from Bangladesh National Census data. All these information are combined that results in a standard machine learning dataset. Together, 36 features are engineered for the crime prediction task. Five supervised machine learning classification algorithms are then evaluated on this newly built dataset and satisfactory results are achieved. We also conduct exploratory analysis on various aspects the dataset. This dataset is expected to serve as the foundation for crime incidence prediction systems for Bangladesh and other countries. The findings of this study will help law enforcement agencies to forecast and contain crime as well as to ensure optimal resource allocation for crime patrol and prevention.
研究动机与目标
- 解决目前孟加拉国缺乏标准化、全面且系统化结构的犯罪数据的问题,当前数据多依赖汇总或不完整来源。
- 构建一个高质量、多维的数据集,将犯罪事件与时间、地理、气象和人口统计特征相结合,以支持机器学习应用。
- 通过构建适合监督学习的数据集,克服数据稀缺和不平衡问题,实现在孟加拉国的准确犯罪预测。
- 提供一个可复现的犯罪数据整理与特征工程框架,适用于其他官方犯罪数据基础设施有限的发展中国家。
提出的方法
- 在七年间(2013–2020年)从一份日报的新闻档案中手动收集了6,574起犯罪新闻文章,提取了事件发生日期、时间、地点和犯罪类型等基本信息。
- 利用标准地理定位服务对原始文本数据进行增强,为每起事件推导出精确的纬度和经度,并从可靠的气象数据库中整合了历史气象数据(温度、湿度、降水量)。
- 从孟加拉国国家人口普查中获取人口统计数据(如人口密度、年龄分布、收入水平),以增强数据集的社会经济背景信息。
- 通过大量特征工程,创建了36个结构化特征,包括一天中的时间、星期几、季节性趋势以及天气条件指标,以提升模型的可解释性和性能。
- 采用数据清洗技术处理缺失值和不一致性,并使用SMOTE过采样技术缓解犯罪类型分布中的类别不平衡问题。
- 使用标准指标(准确率、F1分数、AUC)在工程化后的数据集上评估了五种监督学习分类器——随机森林、XGBoost、AdaBoost、极端梯度提升树和决策树。
实验结果
研究问题
- RQ1如何利用公开可获取且人工整理的数据,系统性地构建适用于孟加拉国的标准化、多源且全面的犯罪数据集?
- RQ2时间、地理、气象和人口统计因素在多大程度上影响孟加拉国的犯罪发生?它们应如何被有效编码为特征?
- RQ3在发展中国家背景下,针对新构建的多维数据集,哪些监督学习模型在犯罪预测中表现最佳?
- RQ4特征工程和数据平衡技术(如SMOTE)在提升该数据集上犯罪预测模型预测性能方面的有效性如何?
主要发现
- 本研究成功构建了孟加拉国首个标准化的犯罪数据集,包含6,574起事件,整合了时间、地理、天气和人口统计特征,涵盖六类犯罪。
- 特征工程显著提升了数据质量和模型准备度,最终形成一个包含36个工程化特征的数据集,适用于机器学习任务。
- 在评估的模型中,XGBoost和随机森林取得了最高的预测准确率,其中XGBoost在F1分数和AUC上表现最优,表明其在类别不平衡的犯罪数据上具有出色的泛化能力。
- SMOTE过采样技术的应用有效减轻了类别不平衡的影响,提升了模型对少数犯罪类别的预测性能。
- 探索性数据分析揭示了犯罪分布中明显的时空模式,例如特定月份和城市中心的案件发生率更高,支持该数据集在政策制定和巡逻规划中的实用性。
- 该数据集是孟加拉国首个同类数据集,为未来研究和该国实际犯罪预测系统提供了全面、多源的基础支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。