Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Variable Selection Method based on Frequent Pattern Tree for Real-time Traffic Accident Risk Prediction

Lei Lin, Qian Wang|arXiv (Cornell University)|2017. 01. 20.
Traffic Prediction and Management Techniques인용 수 7
한 줄 요약

이 논문은 실시간 교통사고 위험을 위한 핵심 예측 변수를 식별하기 위해 빈번한 패턴(FP) 트리 알고리즘과 새로운 상대 대상 순수도 비율(ROPR) 기준을 결합한 새로운 변수 선택 방법을 제안한다. I-64, 버지니아주, 2005년 데이터를 대상으로 평가한 결과, FP 트리 기반의 변수 선택은 예측 정확도를 향상시켰으며, 61.11%의 정확도와 38.16%의 잘못 경고 비율을 기록하여 k-NN 및 베이지안 네트워크 모델에서 랜덤 포레스트 기반 변수 선택을 능가했다.

ABSTRACT

Traffic accident data are usually noisy, contain missing values, and heterogeneous. How to select the most important variables to improve real-time traffic accident risk prediction has become a concern of many recent studies. This paper proposes a novel variable selection method based on the Frequent Pattern tree (FP tree) algorithm. First, all the frequent patterns in the traffic accident dataset are discovered. Then for each frequent pattern, a new criterion, called the Relative Object Purity Ratio (ROPR) which we proposed, is calculated. This ROPR is added to the importance score of the variables that differentiates one frequent pattern from the others. To test the proposed method, a dataset was compiled from the traffic accidents records detected by only one detector on interstate highway I-64 in Virginia in 2005. This data set was then linked to other variables such as real-time traffic information and weather conditions. Both the proposed method based on the FP tree algorithm, as well as the widely utilized, random forest method, were then used to identify the important variables or the Virginia data set. The results indicate that there are some differences between the variables deemed important by the FP tree and those selected by the random forest method. Following this, two baseline models (i.e. a nearest neighbor (k-NN) method and a Bayesian network) were developed to predict accident risk based on the variables identified by both the FP tree method and the random forest method. The results show that the models based on the variable selection using the FP tree performed better than those based on the random forest method for several versions of the k-NN and Bayesian network models.The best results were derived from a Bayesian network model using variables from FP tree. That model could predict 61.11% of accidents accurately, while having a false alarm rate of 38.16%.

연구 동기 및 목표

  • 실시간 위험 예측에서 노이즈가 많고, 완전하지 못하며, 이질적인 교통사고 데이터의 문제를 해결하기 위해.
  • 복잡한 교통 데이터셋에서 가장 관련성이 높은 예측 변수를 식별하는 새로운 변수 선택 방법을 개발하기 위해.
  • 데이터 기반의 패턴 기반 접근 방식을 통해 실시간 교통사고 위험 예측 모델의 정확성과 신뢰성을 향상시키기 위해.
  • 기존 기법들인 랜덤 포레스트와 비교하여 예측 모델링에서 제안된 방법의 성능을 평가하기 위해.

제안 방법

  • FP 트리 알고리즘을 사용하여 교통사고 데이터셋에서 빈번한 패턴을 추출하여 사고 사건에서 공존하는 변수들을 포괄한다.
  • 각 빈번한 패턴에 대해 새로운 상대 대상 순수도 비율(ROPR)을 계산하여 구성 변수의 구분 능력을 정량화한다.
  • ROPR 값은 변수 중요도 점수에 통합되어 고위험 패턴과 저위험 패턴을 가장 잘 구분하는 변수들을 우선순위에 올린다.
  • 선택된 변수들을 사용하여 기준 모델인 k-최근접 이웃(k-NN) 및 베이지안 네트워크를 통해 위험 예측을 위한 학습을 수행한다.
  • FP 트리 기반으로 선택된 변수를 사용한 모델의 성능을 랜덤 포레스트 기반으로 선택된 변수를 사용한 모델과 비교한다.
  • 이 방법은 I-64, 버지니아주, 2005년 실세계 데이터셋을 대상으로 평가되었으며, 실시간 교통 및 기상 데이터가 보강된 상태이다.

실험 결과

연구 질문

  • RQ1제안된 FP 트리 기반 변수 선택 방법과 ROPR가 교통사고 위험 예측을 위한 핵심 예측 변수를 식별하는 데 얼마나 효과적인가?
  • RQ2FP 트리 기반으로 선택된 변수를 사용한 예측 모델의 성능은 랜덤 포레스트 기반으로 선택된 변수를 사용한 모델과 비교해 볼 때 어떻게 되는가?
  • RQ3제안된 방법을 통해 선택된 변수를 사용한 모델의 예측 정확도와 잘못 경고 비율은 무엇인가?
  • RQ4기존의 변수 선택 기법과 비교해 볼 때, FP 트리 기반 접근 방식은 실시간 교통사고 위험 탐지에 어떻게 기여하는가?

주요 결과

  • FP 트리 방법으로 변수를 선택한 베이지안 네트워크 모델이 교통사고 예측 정확도가 가장 높은 61.11%를 기록했다.
  • 동일한 베이지안 네트워크 모델은 잘못 경고 비율이 38.16%로, 탐지 성능과 잘못된 경고 사이의 균형을 잘 유지하고 있음을 나타낸다.
  • k-NN 및 베이지안 네트워크 모델의 다양한 설정에서 FP 트리 기반으로 선택된 변수를 사용한 모델이 랜덤 포레스트 기반으로 선택된 변수를 사용한 모델보다 성능이 뛰어났다.
  • FP 트리 방법은 랜덤 포레스트와는 다른 중요한 변수 조합을 식별하여 사고 위험 요인에 대한 보완적인 통찰을 제공한다.
  • ROPR 기준은 사고 발생 사건과 비사고 사건을 구분하는 데 효과적으로 기여하는 패턴을 강조함으로써 변수 중요도를 효과적으로 향상시켰다.
  • 제안된 방법은 특히 노이즈가 많고 복잡한 교통 데이터셋에서 실시간 사고 위험 예측 성능이 뛰어나다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.