QUICK REVIEW
[논문 리뷰] San Francisco Crime Classification
Yehya Abouelnaga|arXiv (Cornell University)|2016. 07. 13.
한 줄 요약
이 논문은 공개 범죄 데이터에서 시간적, 공간적 특징을 활용하여 샌프란시스코의 범죄 유형을 예측하기 위한 머신러닝 접근법을 제시한다. 주로 주소와 시간에 대한 특징 공학, 주성분 분석(PCA) 및 앙상블 방법(예: 랜덤 포레스트)을 활용하여, 로그 손실(log-loss)이 2.39031인 상위 18%의 순위를 기록한 바 있다.
ABSTRACT
San Francisco Crime Classification is an online competition administered by Kaggle Inc. The competition aims at predicting the future crimes based on a given set of geographical and time-based features. In this paper, I achieved a an accuracy that ranks at top %18, as of May 19th, 2016. I will explore the data, and explain in details the tools I used to achieve that result.
연구 동기 및 목표
- 공개 범죄 데이터에서 시간적 및 공간적 특징을 활용하여 샌프란시스코의 범죄 유형을 예측하는 것.
- 특히 희소한 주소 필드에 대한 고도의 특징 공학을 통해 분류 성능을 향상시키는 것.
- XGBoost, k-NN, 결정 트리, 랜덤 포레스트 등의 다양한 머신러닝 모델을 평가하고 비교하는 것.
- 강력한 모델 튜닝과 차원 축소를 통해 캐글 샌프란시스코 범죄 분류 경연에서 높은 순위를 기록하는 것.
- 향후 성능 향상을 위한 신경망 및 분류기 융합 등의 방향성 탐색
제안 방법
- 'Dates' 필드에서 시간적 특징(시간, 요일, 월)을 추출하여 시간 패턴 탐지 능력을 향상시켰다.
- 주소 필드에서 'StreetNo'와 'Block' 지표를 포함한 새로운 특징을 공학하여 희소한 주소 데이터에 대한 모델 일반화 능력을 향상시켰다.
- 차원 축소 및 과적합 방지를 위해 주성분 분석(PCA)을 3개의 성분으로 적용하였다.
- 로거스 손실(log-loss)을 평가 지표로 사용하여 k-최근접 이웃, XGBoost, 결정 트리, 베이지안, 랜덤 포레스트 등의 다양한 분류기 평가를 수행하였다.
- 특히 랜덤 포레스트의 max_depth와 n_estimators를 최적화하기 위해 그리드 서치를 활용한 하이퍼파라미터 튜닝을 수행하였다.
- 분류기 융합을 활용하고, 향후 향상에 대비해 '카운팅 기반 학습(Learning by Counting)' 및 신경망과 같은 고급 기법을 탐색하였다.
실험 결과
연구 질문
- RQ1샌프란시스코의 범죄 유형과 가장 강하게 상관관계가 있는 시간적 및 공간적 특징는 무엇인가?
- RQ2범죄 분류에 있어 예측 능력을 유지하면서도 차원 축소를 위해 PCA가 얼마나 효과적인가?
- RQ3k-NN, XGBoost, 결정 트리, 랜덤 포레스트 중 어느 머신러닝 모델이 이 데이터셋에서 가장 낮은 로그 손실 성능을 달성하는가?
- RQ4희소한 '주소' 필드에 대한 특징 공학이 분류 정확도 향상에 얼마나 기여하는가?
- RQ5신경망 또는 앙상블 방법이 기존의 트리 기반 모델을 초월해 성능 향상을 이끌 수 있는가?
주요 결과
- 하루 중 시간이 가장 예측 능력이 높은 특징로 나타나 범죄 유형과 가장 높은 상관관계를 보였다.
- max_depth=13, n_estimators=200으로 설정한 랜덤 포레스트가 검증 로그 손실 2.41057을 기록하며 최고의 성능을 보였다.
- 랜덤 포레스트 모델에 StreetNo와 Block 특징을 추가함으로써 로그 손실이 2.366175731로 감소하여 성능 향상이 뚜렷하게 관찰되었다.
- 최종 모델은 테스트 로그 손실 2.39031을 기록하여 캐글 경연에서 상위 18%에 진입(2077개 제출 중 388위)하였다.
- 결정 트리는 놀랍도록 뛰어난 성능을 보였으며, 최적 성능은 max_depth=10, n_elements=256에서 기록되어 로그 손실 2.50849507을 달성하였다.
- XGBoost와 베이지안 분류기는 앙상블 방법에 비해 성능이 열등했으며, XGBoost는 max_depth=5에서 로그 손실 2.57428을 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.