Skip to main content
QUICK REVIEW

[논문 리뷰] Taming Near Repeat Calculation for Crime Analysis via Cohesive Subgraph Computing

Zhaoming Yin, Xuan Shi|arXiv (Cornell University)|2017. 05. 18.
Data Visualization and Analytics참고 문헌 21인용 수 3
한 줄 요약

이 논문은 대규모 공간-시간 범죄 데이터에서 근접 반복 범죄 사건 체인을 효율적으로 탐지하기 위해 R-tree 색인과 밀집된 부분그래프 분석(k-클리크, k-truss, k-core, DBSCAN)을 사용하는 새로운 그래프 기반 프레임워크를 제안한다. 이는 백만 건 이상의 기록을 처리하고 두 건 이상의 사건 체인을 탐지한 최초의 사례로, 기존의 O(n²) 쌍방향 방법에 비해 계산 시간을 줄이며 고차원의 공간-시간 범죄 패턴을 드러내어 뚜렷한 성능 향상을 보였다.

ABSTRACT

Near repeat (NR) is a well known phenomenon in crime analysis assuming that crime events exhibit correlations within a given time and space frame. Traditional NR calculation generates 2 event pairs if 2 events happened within a given space and time limit. When the number of events is large, however, NR calculation is time consuming and how these pairs are organized are not yet explored. In this paper, we designed a new approach to calculate clusters of NR events efficiently. To begin with, R-tree is utilized to index crime events, a single event is represented by a vertex whereas edges are constructed by range querying the vertex in R-tree, and a graph is formed. Cohesive subgraph approaches are applied to identify the event chains. k-clique, k-truss, k-core plus DBSCAN algorithms are implemented in sequence with respect to their varied range of ability to find cohesive subgraphs. Real world crime data in Chicago, New York and Washington DC are utilized to conduct experiments. The experiment confirmed that near repeat is a solid effect in real big crime data by conducting Mapreduce empowered knox tests. The performance of 4 different algorithms are validated, while the quality of the algorithms are gauged by the distribution of number of cohesive subgraphs and their clustering coefficients. The proposed framework is the first to process the real crime data of million record scale, and is the first to detect NR events with size of more than 2.

연구 동기 및 목표

  • 대규모 범죄 데이터셋에서 기존의 O(n²) 근접 반복 계산이 계산적으로 불가능한 문제를 해결하기 위해.
  • 근접 반복 범죄 사건을 그래프로 모델링하여 공간-시간 사건 체인의 확장 가능한 분석을 가능하게 하기 위해.
  • 밀집된 부분그래프 알고리즘(k-클리크, k-truss, k-core, DBSCAN)의 성능를 비교하여 의미 있는 사건 클러스터를 탐지하기 위해.
  • MapReduce 기반의 Knox 테스트를 활용해 실제 범죄 데이터에서 근접 반복 효과의 존재를 검증하기 위해.
  • 실시간 범죄 분석 응용 프로그램을 위해 확장 가능하고 증분 탐지 기능을 갖춘 근접 반복 체인 탐지 기능을 제공하기 위해.

제안 방법

  • 공간-시간 근접성 탐지를 위해 R-tree를 사용해 사건을 색인하여 효율적인 범위 쿼리 기능을 제공한다.
  • 정점이 범죄 사건을 나타내고, 정해진 공간-시간 창 내에 있는 사건들 간에 간선을 연결하는 무방향 그래프를 구축한다.
  • 밀집된 부분그래프 탐지 알고리즘 네 가지—k-클리크, k-truss, k-core, DBSCAN—을 적용하여 근접 반복 사건의 조밀한 클러스터를 식별한다.
  • 대규모 데이터셋에서 근접 반복 효과의 통계적 검증을 위해 MapReduce를 활용해 Knox 테스트를 확장한다.
  • 실행 시간, 밀집된 부분그래프 수, 클러스터링 계수 분포를 통해 알고리즘 성능을 평가한다.
  • 실제 시카고, 뉴욕, 워싱턴 DC의 범죄 데이터를 처리하기 위해 AWS에 프레임워크를 구현한다.

실험 결과

연구 질문

  • RQ1밀집된 부분그래프 분석은 대규모 범죄 데이터에서 이원 상호작용을 초월해 근접 반복 범죄 사건 체인을 효과적으로 탐지할 수 있는가?
  • RQ2k-클리크, k-truss, k-core, DBSCAN와 같은 다양한 밀집된 부분그래프 알고리즘이 근접 반복 탐지에서 계산 효율성과 클러스터링 품질 측면에서 어떻게 비교되는가?
  • RQ3이중 쌍이 아닌 크기가 2 이상인 사건 체인을 분석할 경우, 통계적 Knox 테스트를 통해 근접 반복 효과가 유지되는가?
  • RQ4정확한(k-클리크)과 근사적(k-truss, k-core, DBSCAN) 부분그래프 탐지 방법 간의 성능 상충 관계는 실제 범죄 데이터셋에서 어떻게 나타나는가?
  • RQ5제안된 프레임워크는 증분 탐지 기능을 갖추고 실시간 스트리밍 범죄 데이터에 확장 가능한가?

주요 결과

  • 제안된 프레임워크는 최대 백만 건의 실제 범죄 데이터를 성공적으로 처리하여, 두 건 이상의 사건 체인을 탐지한 최초의 사례를 이룩했다.
  • k-truss는 클러스터링 계수 품질 측면에서 k-core와 DBSCAN를 뛰어넘어 더 조밀하고 의미 있는 사건 체인을 탐지했다.
  • DBSCAN과 k-core는 큰 k 값에서도 안정적인 클러스터링 계수를 보였으며, 이는 높은 밀집도 임계값에서 일관된 공간-시간 패턴을 탐지하고 있음을 시사했다.
  • 주요 계산 비용은 밀집된 부분그래프 탐지에 기인했으며, k-클리크는 지수 시간 복잡도로 인해 큰 그래프에서는 실용적이지 않았다.
  • k-truss와 k-core는 특히 밀도가 높은 큰 그래프에서 k-클리크보다 훨씬 빠른 실행 시간을 보였으며, 이는 근사 방법의 장점을 입증했다.
  • MapReduce 기반 Knox 테스트는 시카고, 뉴욕, 워싱턴 DC의 세 개의 실제 데이터셋 모두에서 상당한 근접 반복 효과가 존재한다는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.