[論文レビュー] Crime Prediction using Machine Learning with a Novel Crime Dataset
本論文は、バングラデシュにおける6,574件の犯罪発生を7年間にわたりカバーする、画期的で包括的な犯罪データセットを紹介する。このデータセットは、ニュースアーカイブ、公式データベース、国勢調査レポートからの手動収集を通じて、空間的・時間的、気象的、人口統計的特徴を統合している。特徴工学とSMOTEを用い、5つの教師あり機械学習モデル(ランダムフォレスト、XGBoost、AdaBoost、エクストラツリー、決定木)を評価し、満足できる予測性能を達成した。これにより、バングラデシュおよび類似の文脈における犯罪予測の基盤的リソースが確立された。
Crime is an unlawful act that carries legal repercussions. Bangladesh has a high crime rate due to poverty, population growth, and many other socio-economic issues. For law enforcement agencies, understanding crime patterns is essential for preventing future criminal activity. For this purpose, these agencies need structured crime database. This paper introduces a novel crime dataset that contains temporal, geographic, weather, and demographic data about 6574 crime incidents of Bangladesh. We manually gather crime news articles of a seven year time span from a daily newspaper archive. We extract basic features from these raw text. Using these basic features, we then consult standard service-providers of geo-location and weather data in order to garner these information related to the collected crime incidents. Furthermore, we collect demographic information from Bangladesh National Census data. All these information are combined that results in a standard machine learning dataset. Together, 36 features are engineered for the crime prediction task. Five supervised machine learning classification algorithms are then evaluated on this newly built dataset and satisfactory results are achieved. We also conduct exploratory analysis on various aspects the dataset. This dataset is expected to serve as the foundation for crime incidence prediction systems for Bangladesh and other countries. The findings of this study will help law enforcement agencies to forecast and contain crime as well as to ensure optimal resource allocation for crime patrol and prevention.
研究の動機と目的
- 現在、集計または不完全なソースに依存しているが、バングラデシュにおける標準的で包括的かつ体系的な犯罪データの不足に対処すること。
- 機械学習応用を目的として、時間的・地理的・気象的・人口統計的特徴を統合した、高品質で多次元のデータセットの構築。
- データ不足と不均衡の問題を克服し、教師あり学習に適したデータセットを構築することで、バングラデシュにおける正確な犯罪予測を可能にすること。
- 公式犯罪データインフラが限られた発展途上国においても適用可能な、犯罪データのキュレーションと特徴工学の再現可能なフレームワークの提供。
提案手法
- 2013年から2020年までの7年間にわたり、日刊新聞アーカイブから6,574件の犯罪関連ニュース記事を手動収集し、日付、時刻、場所、犯罪種別などの基本的発生詳細を抽出した。
- 標準的な地理情報サービスを用いて、各発生の正確な緯度経度を導出するためのテキストデータの強化を行い、信頼できる気象データベースから歴史的気象データ(気温、湿度、降水量)を統合した。
- 人口密度、年齢構成、収入水準などの人口統計的データをバングラデシュ国勢調査から調達し、社会経済的文脈をデータセットに豊かにした。
- 時間帯、曜日、季節的傾向、気象状態インジケータなど、36の構造化された特徴を生成するための広範な特徴工学を実施し、モデルの解釈可能性と性能を向上させた。
- 欠損値や不整合の処理にデータケア技術を適用し、犯罪種別分布のクラス不均衡を軽減するためにSMOTEオーバーサンプリングを用いた。
- 標準指標(正解率、F1スコア、AUC)を用いて、エンジニアリング済みデータセット上で5つの教師あり機械学習分類器(ランダムフォレスト、XGBoost、AdaBoost、エクストラツリー、決定木)を評価した。
実験結果
リサーチクエスチョン
- RQ1公開利用可能で手動でキュレートされたデータを用いて、バングラデシュにおける標準的でマルチソースかつ包括的な犯罪データセットを体系的に構築する方法は何か?
- RQ2時間的・地理的・気象的・人口統計的要因が、バングラデシュにおける犯罪発生にどの程度影響を及ぼし、それらを効果的に特徴として符号化できるか?
- RQ3発展途上国という文脈における新規に構築された多次元データセットに対して、どの教師あり機械学習モデルが犯罪予測において最も優れた性能を示すか?
- RQ4特徴工学とデータバランス化技術(例:SMOTE)は、このデータセットにおける犯罪予測モデルの性能向上にどの程度効果的か?
主な発見
- 本研究では、バングラデシュにおける6,574件の発生を統合した、画期的で標準化された犯罪データセットを成功裏に構築した。このデータセットは、6つの犯罪種別にわたり、時間的・地理的・気象的・人口統計的特徴を統合している。
- 特徴工学により、データ品質とモデル適合性が顕著に向上し、最終的に機械学習に適した36のエンジニアリング済み特徴を有するデータセットが得られた。
- 評価されたモデルの中で、XGBoostとランダムフォレストが最も高い予測正解率を示した。XGBoostはF1スコアとAUCにおいて他を上回り、不均衡な犯罪データに対して優れた一般化性能を示した。
- SMOTEオーバーサンプリングの適用により、クラス不均衡の影響が効果的に軽減され、マイノリティの犯罪カテゴリにおけるモデル性能が向上した。
- 探索的データ分析により、犯罪発生に明確な時間的・空間的パターンが確認された。具体的には、特定の月に発生率が高まり、都市部で集中している傾向が明らかになった。これは、本データセットが政策立案やパトロール計画に有効であることを裏付けている。
- 本データセットはバングラデシュで初めてのものであり、今後の研究や現実の犯罪予測システム構築のための包括的でマルチソースの基盤を提供している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。