Skip to main content
QUICK REVIEW

[論文レビュー] Perfecting the Crime Machine

Yigit Alparslan, Ioanna Panagiotou|arXiv (Cornell University)|Jan 14, 2020
Crime Patterns and Interventions参考文献 12被引用数 8
ひとこと要約

本論文は、スパatiotemporal特徴量を用いてフィラデルフィアの多クラス犯罪種別を予測するため、非教師ありクラスタリングと教師あり分類を組み合わせた新規ハイブリッド機械学習ワークフローを提案する。クラスタ距離を入力特徴量として使用し、ランダムフォレストで最適化することで、ログ損失2.3120を達成し、グリッドベースの空間分割を用いないまま、都市間での一般化を可能にした。

ABSTRACT

This study explores using different machine learning techniques and workflows to predict crime related statistics, specifically crime type in Philadelphia. We use crime location and time as main features, extract different features from the two features that our raw data has, and build models that would work with large number of class labels. We use different techniques to extract various features including combining unsupervised learning techniques and try to predict the crime type. Some of the models that we use are Support Vector Machines, Decision Trees, Random Forest, K-Nearest Neighbors. We report that the Random Forest as the best performing model to predict crime type with an error log loss of 2.3120.

研究の動機と目的

  • グリッドベースの空間分割を回避するスケーラブルで都市に依存しない犯罪予測フレームワークの開発。
  • 非教師ありクラスタリングと教師あり学習を統合することで、多クラス犯罪種別予測の精度を向上させること。
  • 犯罪分類に最も予測力のあるスパティオトロピカル特徴量を同定すること。
  • 高クラスラベル状態(30クラス)下で複数の教師ありモデルを体系的に評価・比較すること。
  • 都市固有の前処理に依存する度合いを低減するため、クラスタ中心点を基準点として用いること。

提案手法

  • 非教師あり手法を用いて犯罪発生位置を年次にクラスタリングし、空間的ホットスポットを定義する。
  • 各犯罪点から最近隣のクラスタ中心までのユークリッド距離を新たな特徴量として計算する。
  • タイムスタンプから時間、分、週の曜日、月などの時間的特徴量を抽出する。
  • 回転座標(Rot30X、Rot45X、Rot60X)を用いた特徴工学により、方向性のパターンを捉える。
  • ランダムフォレスト、SVM、K-近傍法、決定木、ナイーブベイズ、ロジスティック回帰、MLPの複数の教師ありモデルを訓練・チューニングする。
  • 確率スムージングとハイパーパramータチューニングを用いてログ損失を最適化し、モデル性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1犯罪発生位置の非教師ありクラスタリングは、教師あり犯罪種別分類モデルの性能向上に寄与するか?
  • RQ2クラスタ中心までの距離を特徴量として用いる方法は、従来のグリッドベースの空間ビニング手法と比較して、犯罪予測においてどのように優れているか?
  • RQ3どのスパティオトロピカル特徴量の組み合わせが、多クラス犯罪種別予測において最高の予測精度を達成するか?
  • RQ4高基数クラスラベル(30種類の犯罪)下で、異なる教師あり学習モデルはどのように性能を発揮するか?
  • RQ5提案されたワークフローは、都市固有の前処理を一切行わない状態で、他の都市へどの程度一般化可能か?

主な発見

  • ランダムフォレストが最も低いログ損失2.3120を記録し、SVM や K-近傍法を含むすべての他のモデルを上回った。
  • 最高性能を示したモデルは、スムージングパラメータ0.000170でログ損失2.281062を達成し、確率のキャリブレーションが向上した。
  • 特徴量の重要度分析から、Hour、Hour Zone、Y座標、Rot60Xが予測において最も影響力のある特徴量であった。
  • モデルは正解率0.218282を達成したが、30種類の異なるラベルを持つ多クラス犯罪予測の難易度を反映しており、低水準であった。
  • 誤分類率が最も高かったのは犯罪種別20(92,597件の誤分類)と30(49,930件の誤分類)で、平均ログ損失値はそれぞれ2.5779および2.1085であった。
  • このワークフローは都市固有の空間グリッドに依存する度合いを著しく低減し、クラスタベースの特徴工学により、他の都市への一般化を成功させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。