Skip to main content
QUICK REVIEW

[论文解读] Clustering Algorithms to Analyze the Road Traffic Crashes

Mahnaz Rafia Islam, Israt Jahan Jenny|arXiv (Cornell University)|Aug 7, 2021
Traffic Prediction and Management Techniques参考文献 22被引用 5
一句话总结

本文提出将DBSCAN和OPTICS作为识别道路交通事故热点区域的更优聚类算法,克服了K-means等传统方法的局限性。基于北卡罗来纳州的真实事故数据,研究显示DBSCAN和OPTICS在聚类质量和效率方面优于其他算法,其中DBSCAN在保持高轮廓系数和戴维斯-布尔丁指数的同时,执行时间显著更短。

ABSTRACT

Selecting an appropriate clustering method as well as an optimal number of clusters in road accident data is at times confusing and difficult. This paper analyzes shortcomings of different existing techniques applied to cluster accident-prone areas and recommends using Density-Based Spatial Clustering of Applications with Noise (DBSCAN) and Ordering Points To Identify the Clustering Structure (OPTICS) to overcome them. Comparative performance analysis based on real-life data on the recorded cases of road accidents in North Carolina also show more effectiveness and efficiency achieved by these algorithms.

研究动机与目标

  • 为解决现有聚类算法在识别事故多发区域时的局限性,特别是对异常值的敏感性以及需预先确定聚类数量的问题。
  • 评估基于密度的聚类算法(DBSCAN和OPTICS)与划分方法(如K-means)在真实交通事故数据中的有效性。
  • 提供一种稳健、数据驱动的方法,用于识别高频率事故聚类,以支持针对性的安全干预措施。
  • 通过内部验证指标和执行时间比较聚类性能,为研究人员和实践者提供实际指导。

提出的方法

  • 应用DBSCAN和OPTICS两种基于密度的聚类算法,可自动确定聚类数量并有效处理异常值。
  • 使用Calinski-Harabasz指数、戴维斯-布尔丁指数和轮廓系数评估内部聚类有效性和质量。
  • 使用Python的timeit模块在配备8GB内存的Core i3处理器上测量执行时间,以比较计算效率。
  • 在北卡罗来纳州(2007–2018年)的真实事故记录数据集(共21,854条记录)上进行评估,重点关注事故位置的空间聚类。
  • 为对比分析,实施了K-means和Mini-Batch K-means,并预先设定聚类数量以评估对参数选择的敏感性。
  • 按聚类大小排序并分析各算法间的一致性,以评估在识别最易发生事故区域方面的可靠性。
Figure 1: Number of accidents
Figure 1: Number of accidents

实验结果

研究问题

  • RQ1DBSCAN和OPTICS在真实交通事故数据中识别有意义的事故多发聚类方面,与K-means和Mini-Batch K-means相比表现如何?
  • RQ2预先设定聚类数量对聚类性能有何影响?基于密度的算法如何缓解此问题?
  • RQ3哪种聚类算法在交通事故数据中获得最高的内部验证评分(轮廓系数、戴维斯-布尔丁指数、Calinski-Harabasz指数)?
  • RQ4各算法的执行时间如何变化?哪种算法在大规模事故数据分析中实现了速度与准确性的最佳平衡?

主要发现

  • DBSCAN获得了最高的轮廓系数(0.62)和最低的戴维斯-布尔丁指数(0.68),表明其聚类具有更高的紧凑性和分离度,优于其他算法。
  • OPTICS在Calinski-Harabasz指数上略高于DBSCAN(12.3 vs. 11.8),但差异被认为可忽略不计。
  • 对于10,000条记录,DBSCAN耗时1.626秒,显著快于OPTICS的13.349秒。
  • 对于21,854条记录,DBSCAN耗时5.091秒,而OPTICS耗时43.675秒,表明DBSCAN具有更优的计算效率。
  • DBSCAN的最大聚类包含5,435个数据点,与OPTICS的5,435个几乎完全一致,表明尽管执行时间不同,但热点识别结果具有一致性。
  • K-means和Mini-Batch K-means的最大聚类大小分别为8,519和8,521,表明其对初始聚类数量敏感,且热点检测结果不稳定。
Figure 2: Cluster visualization using k-means algorithm
Figure 2: Cluster visualization using k-means algorithm

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。