Skip to main content
QUICK REVIEW

[논문 리뷰] Using Reinforcement Learning with Partial Vehicle Detection for Intelligent Traffic Signal Control

Rusheng Zhang, Akihiro Ishikawa|arXiv (Cornell University)|2018. 07. 04.
Traffic control and management참고 문헌 74인용 수 17
한 줄 요약

이 논문은 V2I 통신(예: DSRC, 블루투스)를 통해 일부 차량만 감지되는 부분적으로 감지된 환경에서 지능형 교통 신호 제어를 위한 딥 Q-학습 강화학습 프레임워크를 제안한다. 낮은 감지율에도 불구하고 시스템은 평균 차량 대기 시간을 크게 감소시키며, 다양한 교통 흐름과 네트워크 구조에서 뛰어난 성능을 보이며, 감지된 차량은 감지되지 않은 차량보다 더 큰 이점을 얻는다.

ABSTRACT

Intelligent Transportation Systems (ITS) have attracted the attention of researchers and the general public alike as a means to alleviate traffic congestion. Recently, the maturity of wireless technology has enabled a cost-efficient way to achieve ITS by detecting vehicles using Vehicle to Infrastructure (V2I) communications. Traditional ITS algorithms, in most cases, assume that every vehicle is observed, such as by a camera or a loop detector, but a V2I implementation would detect only those vehicles with wireless communications capability. We examine a family of transportation systems, which we will refer to as `Partially Detected Intelligent Transportation Systems'. An algorithm that can act well under a small detection rate is highly desirable due to gradual penetration rates of the underlying wireless technologies such as Dedicated Short Range Communications (DSRC) technology. Artificial Intelligence (AI) techniques for Reinforcement Learning (RL) are suitable tools for finding such an algorithm due to utilizing varied inputs and not requiring explicit analytic understanding or modeling of the underlying system dynamics. In this paper, we report a RL algorithm for partially observable ITS based on DSRC. The performance of this system is studied under different car flows, detection rates, and topologies of the road network. Our system is able to efficiently reduce the average waiting time of vehicles at an intersection, even with a low detection rate.

연구 동기 및 목표

  • 제한된 V2I 기술 도입으로 인해 일부 차량만 감지되는 상황에서 지능형 교통 신호 제어의 과제를 해결하기 위해.
  • 감지율이 낮고 점진적으로 증가하는 부분 관찰 환경에서도 효과적으로 기능하는 강화학습 기반 제어 시스템을 개발하기 위해.
  • 다양한 교통 조건, 감지율, 도로 네트워크 유형에서 제안된 방법의 성능을 평가하기 위해.
  • 감지된 차량과 감지되지 않은 차량 간의 이점 차이를 통해 민간 부문의 도입 유인 요건을 강조함으로써 상용화 가능성을 탐색하기 위해.
  • 다중 에이전트 협업 및 차량 감지 서비스를 통한 동적 가격 설정과 같은 향후 확장성을 위한 기반을 마련하기 위해.

제안 방법

  • 시스템은 V2I 통신을 통한 차량 존재의 부분 관찰 기반으로 최적의 교통 신호 단계 전환을 학습하기 위해 딥 Q-학습(DQN)을 활용한다.
  • 상태 표현은 각 진입로의 대기열 길이와 차량 수를 포함하며, 교통 상태를 추정하기 위해 감지된 차량의 데이터만 사용한다.
  • 학습 안정성을 확보하기 위해 재생 메모리와 타겟 네트워크를 사용하는 시뮬레이션 환경에서 Q-네트워크를 훈련시키며, 평균 대기 시간 감소 기반의 희박한 보상 구조를 적용한다.
  • 알고리즘은 흩어진, 중간, 고밀도 교통 흐름과 다양한 도로 네트워크 유형(예: LuST, 격자형)의 여러 시나리오에서 평가된다.
  • 이 방법은 DSRC, RFID, BLE 또는 셀룰러 기반 감지와 같은 어떤 부분 감지 시스템에도 일반화 가능하다.
  • 성능 평가 기준은 평균 차량 대기 시간과 대기열 길이이며, 감지율과 교통량에 대한 민감도 분석을 실시한다.

실험 결과

연구 질문

  • RQ1V2I 기술을 통해 일부 차량만 감지되는 상황에서 강화학습이 교통 신호 제어를 효과적으로 최적화할 수 있는가?
  • RQ2다양한 차량 감지율과 교통 흐름 강도에서 시스템의 성능는 어떻게 변하는가?
  • RQ3감지된 차량과 감지되지 않은 차량 간에 이점이 다르게 나타나는가? 이는 실용적인 상용 사업 모델을 가능하게 하는가?
  • RQ4훈련 조건과 다른 교통 조건에서 테스트할 경우 RL 에이전트의 성능는 얼마나 견고한가?
  • RQ5동적 가격 설정이나 다중 교차로 협업과 같은 향후 확장 기능을 지원할 수 있는가?

주요 결과

  • 강화학습 기반 제어기는 낮은 감지율에서도 교차로에서 평균 차량 대기 시간을 크게 감소시키며, 다양한 교통 조건에서 뛰어난 일반화 능력을 보인다.
  • 감지율이 증가할수록 성능이 渐진적으로 향상되며, 더 많은 차량이 감지될수록 일관된 성과 향상이 나타난다.
  • 감지된 차량은 감지되지 않은 차량보다 더 큰 대기 시간 감소를 경험하며, 이는 민간 부문의 도입 유인 요건을 자연스럽게 제공한다.
  • 복잡한 시나리오인 LuST 구성과 같은 다양한 네트워크 구조에서도 시스템은 강력한 성능 유지를 유지하며, 훈련 조건과 다른 테스트 조건에서도 유사한 성능을 기록한다.
  • 결과적으로 차량 감지를 서비스로 제공함으로써 동적 가격 모델링을 지원할 수 있으며, 유료 사용자에게 우선 순위가 부여된 신호 단계를 제공할 수 있다.
  • 분산된 유인 메커니즘 덕분에 정부 주도 모델에 의존하지 않으며, 시스템은 확장 가능하고 재정적으로 타당성이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.