Skip to main content
QUICK REVIEW

[논문 리뷰] Perfecting the Crime Machine

Yigit Alparslan, Ioanna Panagiotou|arXiv (Cornell University)|2020. 01. 14.
Crime Patterns and Interventions참고 문헌 12인용 수 8
한 줄 요약

이 논문은 스파ati오토포로지컬 특징을 사용하여 필라델피아의 다중 클래스 범죄 유형을 예측하기 위해 비지도 군집화와 지도 학습 분류를 결합한 혁신적인 하이브리드 기계학습 워크플로우를 제안한다. 군집 거리를 입력 특징으로 사용하고 랜덤 포레스트로 최적화함으로써 모델은 로그 손실 2.3120을 기록하며, 격자 기반 공간 분할을 사용하지 않고도 다른 도시로의 일반화가 가능하다.

ABSTRACT

This study explores using different machine learning techniques and workflows to predict crime related statistics, specifically crime type in Philadelphia. We use crime location and time as main features, extract different features from the two features that our raw data has, and build models that would work with large number of class labels. We use different techniques to extract various features including combining unsupervised learning techniques and try to predict the crime type. Some of the models that we use are Support Vector Machines, Decision Trees, Random Forest, K-Nearest Neighbors. We report that the Random Forest as the best performing model to predict crime type with an error log loss of 2.3120.

연구 동기 및 목표

  • 격자 기반 공간 분할을 피하는 스케일러블하고 도시 간 영향 없는 범죄 예측 프레임워크를 개발하기 위해.
  • 비지도 군집화를 지도 학습과 융합하여 다중 클래스 범죄 유형 예측 성능을 향상시키기 위해.
  • 범죄 분류에 가장 예측력 있는 스파티오토포로지컬 특징을 특정하기 위해.
  • 고클래스 레이블 조건(30개 클래스) 하에서 여러 지도 학습 모델을 체계적으로 평가하고 비교하기 위해.
  • 도시별 전처리에 의존도를 줄이기 위해 군집 중심을 기준점으로 사용하기 위해.

제안 방법

  • 비지도 기법을 사용해 연간 범죄 위치를 군집화하여 공간적 핫스팟을 정의하기 위해.
  • 각 범죄 지점에서 가장 가까운 군집 중심까지의 유클리드 거리를 새로운 특징으로 계산하기 위해.
  • 시간 특징으로 시간, 분, 요일, 월을 타임스탬프에서 추출하기 위해.
  • 방향성 패턴을 포착하기 위해 회전된 좌표(Rot30X, Rot45X, Rot60X)를 특징 공학에 적용하기 위해.
  • 다양한 지도 학습 모델(랜덤 포레스트, SVM, K-최근접 이웃, 결정 트리, 나이브 베이즈, 로지스틱 회귀, MLP)을 훈련하고 튜닝하기 위해.
  • 확률 스무oothing과 하이퍼파라미터 튜닝을 통해 로그 손실을 최적화하여 모델 성능을 향상시키기 위해.

실험 결과

연구 질문

  • RQ1범죄 위치의 비지도 군집화가 지도 학습 기반의 범죄 유형 분류 모델 성능 향상에 기여하는가?
  • RQ2군집 중심까지의 거리 특징을 사용하는 것이 기존의 격자 기반 공간 분할에 비해 범죄 예측에서 어떻게 성능이 우월한가?
  • RQ3스파티오토포로지컬 특징의 어떤 조합이 다중 클래스 범죄 유형 예측에서 가장 높은 예측 정확도를 낳는가?
  • RQ4다양한 지도 학습 모델은 고카디널리티 클래스 레이블(30개의 범죄 유형) 조건에서 어떻게 성능을 발휘하는가?
  • RQ5제안된 워크플로우는 도시별 전처리 없이 다른 도시로 얼마나 잘 일반화될 수 있는가?

주요 결과

  • 랜덤 포레스트는 모든 다른 모델, 특히 SVM과 K-최근접 이웃보다 낮은 로그 손실 2.3120을 기록하여 가장 뛰어난 성능을 보였다.
  • 가장 뛰어난 성능을 보인 모델은 스무oothing 파rameter 0.000170을 사용하여 로그 손실 2.281062를 기록했으며, 확률 캘리브레이션 향상이 확인되었다.
  • 특징 중요도 분석 결과, 시간, 시간대, Y좌표, Rot60X가 예측에 가장 영향력 있는 특징으로 나타났다.
  • 모델은 정확도 0.218282를 기록했으며, 이는 30개의 서로 다른 레이블을 가진 다중 클래스 범죄 예측의 과제를 반영하는 낮은 성능이지만 의미가 있다.
  • 가장 높은 오분류 비율은 범죄 유형 20(92,597건의 오분류)과 30(49,930건의 오분류)에서 관찰되었으며, 평균 로그 손실 값은 각각 2.5779와 2.1085였다.
  • 워크플로우는 도시별 전용 공간 격자에 대한 의존도를 효과적으로 줄였으며, 군집 기반 특징 공학을 통해 다른 도시 환경으로의 일반화를 성공적으로 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.