[논문 리뷰] A Comparative Study on Crime in Denver City Based on Machine Learning and Data Mining
이 연구는 대규모 덴버 범죄 데이터셋(478,578건의 사건, 2014–2019년)을 대상으로 다양한 기계학습 및 데이터 마이닝 기법을 적용하여 15개의 범죄 유형을 예측한다. 통계 분석, 시각화 및 분류 모델(집합 학습 방법 포함)을 통해 Ensemble Model 4는 정확도 90% 이상을 달성하여 정밀도, 재현율, F1 점수 및 ROC 분석에서 다른 모델들을 압도적으로 뛰어넘었으며, 경찰 및 범죄 예방을 위한 실질적인 통찰을 제공한다.
To ensure the security of the general mass, crime prevention is one of the most higher priorities for any government. An accurate crime prediction model can help the government, law enforcement to prevent violence, detect the criminals in advance, allocate the government resources, and recognize problems causing crimes. To construct any future-oriented tools, examine and understand the crime patterns in the earliest possible time is essential. In this paper, I analyzed a real-world crime and accident dataset of Denver county, USA, from January 2014 to May 2019, which containing 478,578 incidents. This project aims to predict and highlights the trends of occurrence that will, in return, support the law enforcement agencies and government to discover the preventive measures from the prediction rates. At first, I apply several statistical analysis supported by several data visualization approaches. Then, I implement various classification algorithms such as Random Forest, Decision Tree, AdaBoost Classifier, Extra Tree Classifier, Linear Discriminant Analysis, K-Neighbors Classifiers, and 4 Ensemble Models to classify 15 different classes of crimes. The outcomes are captured using two popular test methods: train-test split, and k-fold cross-validation. Moreover, to evaluate the performance flawlessly, I also utilize precision, recall, F1-score, Mean Squared Error (MSE), ROC curve, and paired-T-test. Except for the AdaBoost classifier, most of the algorithms exhibit satisfactory accuracy. Random Forest, Decision Tree, Ensemble Model 1, 3, and 4 even produce me more than 90% accuracy. Among all the approaches, Ensemble Model 4 presented superior results for every evaluation basis. This study could be useful to raise the awareness of peoples regarding the occurrence locations and to assist security agencies to predict future outbreaks of violence in a specific area within a particular time.
연구 동기 및 목표
- 덴버의 범죄 패턴을 정확하게 예측하는 모델을 개발하여 경찰 및 정부의 자원 배분을 지원한다.
- 덴버 카운티의 실제 사건 데이터를 활용해 고위험 범죄 유형과 지역을 특정한다.
- 15개의 구분된 범죄 유형을 분류하는 데 있어 다양한 기계학습 알고리즘의 성능을 비교한다.
- 훈련-테스트 분할 및 k-겹 교차검증을 통해 다수의 지표에서 모델의 강건성을 평가한다.
- 데이터 기반 예측 및 시공간 추세 분석을 통해 범죄 예방을 위한 실질적인 통찰을 제공한다.
제안 방법
- 2014년 1월부터 2019년 5월까지 덴버의 범죄 데이터에서 시간적 및 공간적 패턴을 탐색하기 위해 통계 분석 및 데이터 시각화를 적용하였다.
- 10개의 분류 알고리즘을 구현: 랜덤 포레스트, 의사결정나무, AdaBoost, 엑스트라 트리, 선형 판별 분석, K-최근접 이웃, 그리고 네 가지 집합 모델.
- 일반화 및 안정성을 확보하기 위해 훈련-테스트 분할 및 k-겹 교차검증을 사용해 모델을 평가하였다.
- 정밀도, 재현율, F1 점수, 평균제곱오차(MSE), ROC 곡선, 대응 t-검정을 측정 지표로 사용하였다.
- 모든 평가 지표에서 일관되게 뛰어난 성능을 보인 모델을 최종 선택하였다.
- 최종 모델을 활용해 예측 추세를 도출하고 전략적 범죄 예방 계획 수립을 지원하였다.
실험 결과
연구 질문
- RQ1덴버에서 15개의 구분된 범죄 유형을 예측하는 데 있어 어떤 기계학습 모델이 가장 높은 정확도를 달성하는가?
- RQ2다양한 집합 및 기본 분류기 모델들이 덴버 범죄 데이터셋에서 정밀도, 재현율, F1 점수 측면에서 어떻게 비교되는가?
- RQ32014년부터 2019년까지 덴버의 범죄 사건에서 가장 두드러진 시간적 및 공간적 패턴은 무엇인가?
- RQ4훈련-테스트 분할 및 k-겹 교차검증과 같은 다양한 평가 전략에서 예측 성능는 얼마나 강건한가?
- RQ5모델은 고위험 범죄 유형과 지역을 신뢰성 있게 식별하여 사전 경찰 대응을 위한 실질적 조치를 취할 수 있는가?
주요 결과
- Ensemble Model 4는 모든 평가 지표에서 가장 높은 정확도를 기록하여 다른 모든 모델을 압도하였다.
- 랜덤 포레스트, 의사결정나무, 그리고 세 개의 다른 집합 모델이 90% 이상의 정확도를 달성하여 강력한 예측 성능를 보였다.
- AdaBoost를 제외한 모든 모델가 높은 정밀도, 재현율 및 F1 점수를 기록하여 만족스러운 성능를 보였다.
- 모델의 성능는 훈련-테스트 분할 및 k-겹 교차검증 모두에서 일관되게 뛰어나 강건성을 입증하였다.
- ROC 곡선 분석을 통해 높은 분류 능력이 확인되었으며, 특히 Ensemble Model 4에서 두드러졌다.
- 대응 t-검정을 통해 통계적으로 유의미한 성능 차이가 확인되었고, Ensemble Model 4는 다른 모델들보다 유의미하게 뛰어났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.