[논문 리뷰] The design of a streaming analytical workflow for processing massive transit feeds
이 논문은 실시간 이동성 분석을 위한 대규모 지속적 교통 데이터 피드를 처리하기 위해 Hadoop MapReduce 기반의 스트리밍 분석 워크플로우를 제시한다. 데이터 수신, 정제 및 맥락화를 통합하여 정확한 도착/출발 시간과 여정 경로 계산을 포함한 특징을 제공하며, 클라우드 환경에서 높은 확장성과 성능를 입증한다. 향후 지연 시간을 줄이기 위한 퍼그 컴퓨팅 통합 가능성을 시사한다.
Retrieving and analyzing transit feeds relies on working with analytical workflows that can handle the massive volume of data streams that are relevant to understand the dynamics of transit networks which are entirely deterministic in the geographical space in which they takes place. In this paper, we consider the fundamental issues in developing a streaming analytical workflow for analyzing the continuous arrival of multiple, unbounded transit data feeds for automatically processing and enriching them with additional information containing higher level concepts accordingly to a particular mobility context. This workflow consists of three tasks: (1) stream data retrieval for creating time windows; (2) data cleaning for handling missing data, overlap data or redundant data; and (3) data contextualization for computing actual arrival and departure times as well as the stops and moves during a bus trip, and also performing mobility context computation. The workflow was implemented in a Hadoop cloud ecosystem using data streams from the CODIAC Transit System of the city of Moncton, NB. The Map() function of MapReduce is used to retrieve and bundle data streams into numerous clusters which are subsequently handled in a parallel manner by the Reduce() function in order to execute the data contextualization step. The results validate the need for cloud computing for achieving high performance and scalability, however, due to the delay in computing and networking, it is clear that data cleaning tasks should not only be deployed using a cloud environment, paving the way to combine it with fog computing in the near future.
연구 동기 및 목표
- 고속도량의 지속적 교통 데이터 스트림을 실시간으로 분석하는 데 도전하는 데 목적을 두며.
- 다양한 소스에서 오는 무한대의 교통 피드를 처리하기 위한 확장성 있고 병렬 처리 가능한 워크플로우를 설계하는 데 목적을 두며.
- 정지, 이동, 실제 도착/출발 시간을 포함한 이동성 맥락의 정확한 계산을 가능하게 하는 데 목적을 두며.
- 대규모 교통 분석을 위한 클라우드 기반 처리의 성능와 실현 가능성을 평가하는 데 목적을 두며.
- 지연 시간의 한계를 파악하고 향후 최적화를 위한 하이브리드 클라우드-퍼그 아키텍처를 제안하는 데 목적을 두며.
제안 방법
- 워크플로우는 Hadoop 생태계를 활용하여 분산 스트림 처리를 위해 MapReduce를 사용하여 구현된다.
- Map() 함수는 들어오는 데이터 스트림을 시간 창 기반의 클러스터로 집계하고 묶어 병렬 처리를 가능하게 한다.
- Reduce() 함수는 여정 재구성 및 이동성 맥락 계산을 포함한 데이터 맥락화를 수행한다.
- 데이터 정제는 스트림 내 누락, 겹침 또는 중복 데이터를 해결하기 위해 적용된다.
- 지속적인 데이터 수신을 관리하고 시간적 일관성을 유지하기 위해 시간 창 기반 데이터 검색을 사용한다.
- 대규모 데이터 워크로드를 위한 고성능과 고확장성을 달성하기 위해 클라우드 인프라를 활용한다.
실험 결과
연구 질문
- RQ1대규모 지속적 교통 데이터 피드를 실시간으로 처리하기 위한 확장성 있는 분석 워크플로우를 어떻게 설계할 수 있는가?
- RQ2클라우드 환경에서 Hadoop MapReduce를 사용한 스트리밍 교통 데이터 처리의 성능 특성은 무엇인가?
- RQ3어떻게 데이터 정제와 맥락화를 교통 네트워크의 스트리밍 파이프라인에 효과적으로 통합할 수 있는가?
- RQ4클라우드 기반 스트리밍 처리에서 지연 시간 문제는 무엇이며, 이를 어떻게 완화할 수 있는가?
- RQ5퍼그 컴퓨팅은 저지연 시간의 교통 분석을 위한 클라우드 기반 처리와 얼마나 잘 보완할 수 있는가?
주요 결과
- Hadoop 기반 워크플로우는 대규모 교통 데이터 스트림 처리에 높은 성능과 확장성을 성공적으로 달성한다.
- MapReduce의 사용은 분산 노드 간 데이터 맥락화 작업의 효율적 병렬 처리를 가능하게 한다.
- 데이터 정제가 지연 시간으로 인해 주요 병목 현상으로 나타나며, 최적화된 사전 처리가 필요함을 시사한다.
- 시스템은 정지, 이동, 실제 도착/출발 시간을 포함한 정확한 여정 수준의 정보를 효과적으로 계산한다.
- 클라우드와 퍼그 컴퓨팅을 조합하면 처리 지연 시간을 줄이고 실시간 반응성을 향상시킬 수 있음을 시사한다.
- 자동화된 대규모 교통 데이터 정제가 이동성 맥락 분석에 실현 가능함을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.