Skip to main content
QUICK REVIEW

[논문 리뷰] Big Data application in congestion detection and classification using Apache spark

Atousa Zarindast, Anuj Sharma|arXiv (Cornell University)|2021. 01. 16.
Traffic Prediction and Management Techniques참고 문헌 17인용 수 4
한 줄 요약

이 논문은 아이오와 주 고속도로에서 76GB의 프로브 차량 데이터를 사용하여 공간적·시간적 혼잡도 탐지 및 반복 혼잡도(RC) 분류를 위한 확장성 있고 스파크 기반의 대용량 데이터 프레임워크를 제안한다. 아파치 스파크의 메모리 기반 처리 및 HDFS 스토리지 기반으로, 계산 시간을 99.88% 감소시키면서도 90%의 정확도를 유지하여, 3,017개의 고속도로 구간에서 거의 실시간 교통 관리 및 패턴 식별을 가능하게 한다.

ABSTRACT

With the era of big data, an explosive amount of information is now available. This enormous increase of Big Data in both academia and industry requires large-scale data processing systems. A large body of research is behind optimizing Spark's performance to make it state of the art, a fast and general data processing system. Many science and engineering fields have advanced with Big Data analytics, such as Biology, finance, and transportation. Intelligent transportation systems (ITS) gain popularity and direct benefit from the richness of information. The objective is to improve the safety and management of transportation networks by reducing congestion and incidents. The first step toward the goal is better understanding, modeling, and detecting congestion across a network efficiently and effectively. In this study, we introduce an efficient congestion detection model. The underlying network consists of 3017 segments in I-35, I-80, I-29, and I-380 freeways with an overall length of 1570 miles and averaged (0.4-0.6) miles per segment. The result of congestion detection shows the proposed method is 90% accurate while has reduced computation time by 99.88%.

연구 동기 및 목표

  • 대규모 고속도로 네트워크 전반에서 혼잡도 및 반복 혼잡도(RC)를 탐지하기 위한 확장성 있고 고성능의 대용량 데이터 프레임워크를 개발하는 것.
  • 이전 연구들이 소규모 지리적 지역이나 짧은 시간 범위에 국한되어 있음을 고려하여, 종합적인 공간적·시간적 분석을 가능하게 하는 것.
  • 실시간 교통 관리 응용을 위해 계산 시간과 비용을 줄이면서도 높은 탐지 정확도를 유지하는 것.
  • 아파치 스파크의 메모리 기반 처리 및 HDFS를 활용하여 대규모 교통 데이터의 효율적이고 분산된 처리를 수행하는 것.
  • 실시간 교통 모니터링 및 정책 수립에 적용 가능한 일반화 가능하고 계산적으로 효율적인 솔루션을 제공하는 것.

제안 방법

  • 프레임워크는 아파치 스파크의 내구성 있는 분산 데이터셋(RDD) 모델을 사용하여 아이오와 주 고속도로(I-35, I-80, I-29, I-380)의 76GB 프로브 차량 속도 데이터를 3,017개 구간에 걸쳐 처리한다.
  • 데이터는 확장성 있고 장애 내성 있는 데이터 액세스를 가능하게 하는 하둡 분산 파일 시스템(HDFS)을 사용해 저장 및 관리한다.
  • 이 방법은 세 단계 파이프라인을 적용한다: (1) 데이터 전처리, (2) 혼잡도 식별을 위한 베이지안 변화점 탐지, (3) 반복적 혼잡도 대비 비반복적 혼잡도 분류.
  • 속도 프로파일은 구간별로 하루 시간대별로 분석되어 혼잡 이벤트를 탐지하며, 반복 혼잡도는 정상적인 정점 시간대에 일관되게 발생하는 혼잡으로 정의된다.
  • 시스템은 고수준 프로그래밍을 위해 파이스파크를 사용하며, 메모리 기반 계산, 분할, 브로드캐스트 변수와 같은 스파크 최적화 기법을 활용해 성능을 향상시킨다.
  • 정확도는 표준 지표인 참양성(TP), 참음성(TN), 거짓양성(FP), 거짓음성(FN)을 사용해 평가되며, 정확도는 (TP + TN) / (TP + TN + FP + FN)로 계산된다.

실험 결과

연구 질문

  • RQ1대규모 다중 구간 고속도로 네트워크 전반에서 혼잡도 및 반복 혼잡도 패턴을 탐지하기 위한 대용량 데이터 프레임워크는 어떻게 설계될 수 있는가?
  • RQ2스파크는 전통적인 데이터 기반 방법에 비해 혼잡도 탐지에서 계산 시간과 비용을 얼마나 줄일 수 있는가?
  • RQ3확장 가능한 대용량 데이터 처리 파이프라인을 통한 교통 혼잡도 분석에서, 정확도와 계산 효율성 사이의 상호 상충 관계는 어떠한가?
  • RQ4스파크와 같은 분산 메모리 처리 시스템은 테라바이트 규모의 교통 데이터를 거의 실시간으로 처리하면서도 높은 정확도를 달성할 수 있는가?
  • RQ5제안된 방법은 동일한 데이터셋에서 최근에 발표된 데이터 기반 혼잡도 탐지 방법과 성능 및 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 프레임워크는 계산 효율성 측면에서 기준 방법보다 뚜렷이 뛰어난 90%의 혼잡도 탐지 정확도를 달성했다.
  • 동일한 하드웨어 자원을 사용하여 계산 시간이 151시간(기준)에서 단 10분으로 99.88% 감소했다.
  • 아마존 웹 서비스(AWS)에서 총 처리 비용은 488달러에서 1.34달러로 감소하여 극적인 비용 절감 효과를 보였다.
  • 이 방법은 반복 혼잡도 패턴을 성공적으로 식별했으며, 디모인 루프에서는 정점 시간대에 일관된 혼잡이 발생하는 것으로 확인되었으며, 그림 5와 6의 시각화 자료에서 뒷받침된다.
  • 상호 상충 분석 결과, 정확도를 10% 감소시킬 경우 처리 시간은 99.88% 감소시키는 데 성공하여 강력한 확장성과 효율성을 입증했다.
  • 프레임워크는 76GB의 데이터를 3,017개 고속도로 구간(1,570마일)에 걸쳐 10분 만에 처리하여 높은 확장성과 실시간 처리 가능성의 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.