Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering Algorithms to Analyze the Road Traffic Crashes

Mahnaz Rafia Islam, Israt Jahan Jenny|arXiv (Cornell University)|2021. 08. 07.
Traffic Prediction and Management Techniques참고 문헌 22인용 수 5
한 줄 요약

이 논문은 기존 방법들인 K-means와 같은 전통적 방법의 한계를 극복하기 위해 도로 교통 사고의 핫스팟을 식별하는 데 DBSCAN과 OPTICS를 우수한 군집 알고리즘으로 제안한다. 실제 노스캐롤라이나주 사고 데이터를 사용하여, DBSCAN과 OPTICS가 군집 품질과 효율성 면에서 다른 알고리즘을 능가함을 입증하였다. 특히 DBSCAN는 높은 실루엣 점수와 다이비스-불딩 지수를 유지하면서도 실행 시간이 훨씬 빠르게 나타났다.

ABSTRACT

Selecting an appropriate clustering method as well as an optimal number of clusters in road accident data is at times confusing and difficult. This paper analyzes shortcomings of different existing techniques applied to cluster accident-prone areas and recommends using Density-Based Spatial Clustering of Applications with Noise (DBSCAN) and Ordering Points To Identify the Clustering Structure (OPTICS) to overcome them. Comparative performance analysis based on real-life data on the recorded cases of road accidents in North Carolina also show more effectiveness and efficiency achieved by these algorithms.

연구 동기 및 목표

  • 기존 군집 알고리즘의 한계, 특히 외곽치에 대한 민감성과 사전에 군집 수를 정해야 하는 요구사항을 해결하기 위해.
  • 실제 도로 사고 데이터에서 K-means와 같은 분할 기반 방법과 비교하여 밀도 기반 군집 알고리즘인 DBSCAN와 OPTICS의 효과성을 평가하기 위해.
  • 고빈도 사고 군집을 식별하기 위한 강력하고 데이터 기반의 접근 방식을 제공하기 위해.
  • 내부 검증 지표와 실행 시간을 사용하여 군집 성능을 비교함으로써 연구자와 실무자에게 실용적인 지침을 제공하기 위해.

제안 방법

  • 외곽치를 효과적으로 처리하고 군집 수를 자동으로 결정하는 밀도 기반 군집 알고리즘인 DBSCAN과 OPTICS를 적용하였다.
  • 내부 군집 타당성과 품질 평가를 위해 칼린스키-하라바슈 지수, 다이비스-불딩 지수, 실루엣 계수를 사용하였다.
  • 컴퓨터 성능을 비교하기 위해 파이썬의 timeit 모듈을 사용하여 코어 i3 프로세서(8GB RAM) 환경에서 실행 시간을 측정하였다.
  • 공간 군집화에 중점을 두고 2007~2018년 동안의 노스캐롤라이나주에서 수집한 실제 21,854건의 도로 사고 기록 데이터셋을 사용하여 평가하였다.
  • 비교 분석을 위해 K-means와 마이너스 배치 K-means를 구현하였으며, 군집 수를 사전에 정의하여 파rameter 선택 민감도를 평가하였다.
  • 군집 크기 기준으로 순위를 매기고 알고리즘 간 일관성을 분석하여 가장 사고가 많은 지역을 식별하는 데의 신뢰성을 평가하였다.
Figure 1: Number of accidents
Figure 1: Number of accidents

실험 결과

연구 질문

  • RQ1DBSCAN와 OPTICS는 실질적인 도로 사고 데이터에서 K-means와 마이너스 배치 K-means에 비해 의미 있는 사고 집중 지역을 얼마나 잘 식별하는가?
  • RQ2사전에 정의된 군집 수가 군집 성능에 어떤 영향을 미치며, 밀도 기반 알고리즘이 이 문제를 어떻게 완화하는가?
  • RQ3어느 군집 알고리즘이 도로 사고 데이터에 대해 가장 높은 내부 검증 지표(Silhouette, Davies-Bouldin, Calinski-Harabasz)를 달성하는가?
  • RQ4알고리즘 간 실행 시간은 어떻게 달라지며, 대규모 사고 데이터 분석에서 속도와 정확도의 최적 균형을 이루는 것은 무엇인가?

주요 결과

  • DBSCAN는 가장 높은 실루엣 계수(0.62)와 가장 낮은 다이비스-불딩 지수(0.68)를 기록하여 다른 알고리즘에 비해 군집의 응집도와 분리도가 뛰어나다는 것을 나타냈다.
  • OPTICS는 칼린스키-하라바슈 지수에서 DBSCAN(11.8)에 비해 略로 높은 점수(12.3)를 기록하였지만, 이 차이는 무시할 만한 수준이었다.
  • 10,000건의 데이터에 대해 DBSCAN는 1.626초, OPTICS는 동일한 데이터셋에서 13.349초가 소요되어 DBSCAN의 실행 시간이 훨씬 빠르게 나타났다.
  • 21,854건의 데이터에 대해 DBSCAN는 5.091초, OPTICS는 43.675초가 소요되어 DBSCAN의 우수한 계산 효율성을 입증하였다.
  • DBSCAN의 가장 큰 군집에는 5,435개의 데이터 포인트가 포함되어 있었고, OPTICS의 경우도 정확히 동일한 5,435개로 일관된 핫스팟 식별을 보였다.
  • K-means와 마이너스 배치 K-means는 각각 8,519개와 8,521개의 가장 큰 군집 크기를 기록하여 군집 수 설정에 민감하고 핫스팟 탐지의 안정성이 떨어지는 것으로 나타났다.
Figure 2: Cluster visualization using k-means algorithm
Figure 2: Cluster visualization using k-means algorithm

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.