Skip to main content
QUICK REVIEW

[논문 리뷰] Increasing performance of electric vehicles in ride-hailing services using deep reinforcement learning

Jacob F. Pettit, Ruben Glatt|arXiv (Cornell University)|2019. 12. 07.
Transportation and Mobility Innovations참고 문헌 13인용 수 7
한 줄 요약

이 논문은 트러스트 영역 정책 최적화(TRPO)를 사용하는 딥 강화학습(DRL) 접근법을 제안하여 릭헤일링 전기차(EVs)의 주행 및 충전 정책을 최적화함으로써 에너지 비용과 배출가스를 감소시킨다. DRL 에이전트는 에너지 가격과 교통 혼잡도가 낮은 비피크 시간대에 충전함으로써 히وري스틱 정책보다 뛰어난 성능을 보이며, 마일당 수익은 높이고 비용은 낮춘다.

ABSTRACT

New forms of on-demand transportation such as ride-hailing and connected autonomous vehicles are proliferating, yet are a challenging use case for electric vehicles (EV). This paper explores the feasibility of using deep reinforcement learning (DRL) to optimize a driving and charging policy for a ride-hailing EV agent, with the goal of reducing costs and emissions while increasing transportation service provided. We introduce a data-driven simulation of a ride-hailing EV agent that provides transportation service and charges energy at congested charging infrastructure. We then formulate a test case for the sequential driving and charging decision making problem of the agent and apply DRL to optimize the agent's decision making policy. We evaluate the performance against hand-written policies and show that our agent learns to act competitively without any prior knowledge.

연구 동기 및 목표

  • 이동 수요 서비스에서의 전기차 운영 과제인 주행 범위 제한, 긴 충전 시간, 변동하는 에너지 가격 및 수요를 해결하기 위해.
  • 동적 에너지 가격, 배출가스, 슈어지 가격, 충전소 대기열 등을 포함한 실제 세계의 요소를 모델링하는 데이터 기반 시뮬레이션 환경을 개발하기 위해.
  • 사전 지식 없이 최적의 주행 및 충전 정책을 학습하는 DRL 에이전트를 훈련시켜 비용 효율성과 서비스 성능을 향상시키기 위해.
  • 실제 세계 유사 조건에서 수동으로 설정된 임계값 기반 정책과 비교하여 DRL 에이전트의 성능을 평가함으로써 그 우월성을 입증하기 위해.
  • 개별 전기차 에이전트에 대한 DRL 최적화의 가능성을 입증하고, 향후 스케일러블 플릿 수준 응용을 위한 길을 열기 위해.

제안 방법

  • 연구는 전기차의 의사결정 과정을 마르코프 결정 과정(MDP)으로 공식화하며, 상태 관측치로는 배터리 잔량, 시간대, 예상 충전 비용, 배출가스, 대기 시간 등을 포함한다.
  • OpenAI Gym을 사용하여 맞춤형 시뮬레이션 환경을 구축하였으며, 뉴욕 맨해튼 기반의 릭헤일링 서비스를 시뮬레이션하며 120개의 공간 영역, 100kWh 배터리 용량, 100kW 충전 스테이션을 포함한다.
  • 환경는 캘리포니아의 시간에 따라 변하는 전력 그리드 데이터를 모델링하며, 시간당 에너지 가격과 CO₂ 배출량을 포함하고, 트립 생성을 위해 실제 뉴욕 시 택시 이동 데이터를 사용한다.
  • 에이전트의 행동 공간은 이산적이다: 각 타임스텝에서 충전할지 또는 승객을 수락할지를 선택할 수 있으며, 보상 함수는 배터리 사용 부족을 방지하고 성공적인 승객 수송을 장려한다.
  • 정책 학습에 트러스트 영역 정책 최적화(TRPO) 알고리즘을 사용하였으며, 두 층의 신경망과 하이퍼볼릭 tangent 활성화 함수를 사용한다.
  • 훈련에는 할인 요소 0.8과 배치 크기 4096을 사용하였으며, 각 에피소드는 연속된 1주일 간의 서비스를 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1DRL 에이전트는 사전 지식 없이도 최적의 주행 및 충전 정책을 학습하여 단순 히وري스틱 규칙보다 뛰어난 성능을 낼 수 있는가?
  • RQ2DRL 에이전트는 저에너지 가격 및 저대기 시간대에 충전함으로써 시간적·공간적 아르비트리지 기회를 활용하는가?
  • RQ3고정된 배터리 임계값 기반 정책과 비교할 때 DRL 에이전트의 성능은 어떠한가?
  • RQ4에이전트는 높은 서비스 가용성과 수익을 유지하면서 에너지 비용과 배출가스를 줄일 수 있는가?
  • RQ5에이전트의 충전 행동 패턴은 최적의 경제적 및 환경 조건과 일치하는가?

주요 결과

  • DRL 에이전트는 테스트된 모든 히وري스틱 정책보다 높은 평균 보상을 달성하여 비용 및 수익 최적화에서 뛰어난 성능을 보였다.
  • 에이전트는 주로 새벽 중간 무렵과 오후 12시前后에 충전함을 학습하여 에너지 가격이 낮고 충전소 혼잡도가 적은 시간대를 선호했다.
  • 에이전트는 출퇴근 정점 시간대에 충전을 피했으며, 이는 슈어지 가격 상승과 높은 승객 및 충전 수요로 인해 경제적으로 비효율적인 시기였다.
  • Figure 1(b)에 나타나 있듯이, 에이전트의 마일당 비용은 히وري스틱 정책보다 유의미하게 낮아 경제적 효율성이 향상됨을 보여주었다.
  • 훈련 과정에서 안정적인 학습이 이루어졌으며, 2,500 에피소드가 넘는 동안 평균 에피소드 보상이 증가하고, 변동성이 낮은 일관된 이동 평균을 유지했다.
  • 에이전트의 행동은 경제적 및 환경 최적화와 일치하였으며, 고비용 및 고배출 충전 시기를 피하는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.