[논문 리뷰] Increasing performance of electric vehicles in ride-hailing services using deep reinforcement learning
이 논문은 트러스트 영역 정책 최적화(TRPO)를 사용하는 딥 강화학습(DRL) 접근법을 제안하여 릭헤일링 전기차(EVs)의 주행 및 충전 정책을 최적화함으로써 에너지 비용과 배출가스를 감소시킨다. DRL 에이전트는 에너지 가격과 교통 혼잡도가 낮은 비피크 시간대에 충전함으로써 히وري스틱 정책보다 뛰어난 성능을 보이며, 마일당 수익은 높이고 비용은 낮춘다.
New forms of on-demand transportation such as ride-hailing and connected autonomous vehicles are proliferating, yet are a challenging use case for electric vehicles (EV). This paper explores the feasibility of using deep reinforcement learning (DRL) to optimize a driving and charging policy for a ride-hailing EV agent, with the goal of reducing costs and emissions while increasing transportation service provided. We introduce a data-driven simulation of a ride-hailing EV agent that provides transportation service and charges energy at congested charging infrastructure. We then formulate a test case for the sequential driving and charging decision making problem of the agent and apply DRL to optimize the agent's decision making policy. We evaluate the performance against hand-written policies and show that our agent learns to act competitively without any prior knowledge.
연구 동기 및 목표
- 이동 수요 서비스에서의 전기차 운영 과제인 주행 범위 제한, 긴 충전 시간, 변동하는 에너지 가격 및 수요를 해결하기 위해.
- 동적 에너지 가격, 배출가스, 슈어지 가격, 충전소 대기열 등을 포함한 실제 세계의 요소를 모델링하는 데이터 기반 시뮬레이션 환경을 개발하기 위해.
- 사전 지식 없이 최적의 주행 및 충전 정책을 학습하는 DRL 에이전트를 훈련시켜 비용 효율성과 서비스 성능을 향상시키기 위해.
- 실제 세계 유사 조건에서 수동으로 설정된 임계값 기반 정책과 비교하여 DRL 에이전트의 성능을 평가함으로써 그 우월성을 입증하기 위해.
- 개별 전기차 에이전트에 대한 DRL 최적화의 가능성을 입증하고, 향후 스케일러블 플릿 수준 응용을 위한 길을 열기 위해.
제안 방법
- 연구는 전기차의 의사결정 과정을 마르코프 결정 과정(MDP)으로 공식화하며, 상태 관측치로는 배터리 잔량, 시간대, 예상 충전 비용, 배출가스, 대기 시간 등을 포함한다.
- OpenAI Gym을 사용하여 맞춤형 시뮬레이션 환경을 구축하였으며, 뉴욕 맨해튼 기반의 릭헤일링 서비스를 시뮬레이션하며 120개의 공간 영역, 100kWh 배터리 용량, 100kW 충전 스테이션을 포함한다.
- 환경는 캘리포니아의 시간에 따라 변하는 전력 그리드 데이터를 모델링하며, 시간당 에너지 가격과 CO₂ 배출량을 포함하고, 트립 생성을 위해 실제 뉴욕 시 택시 이동 데이터를 사용한다.
- 에이전트의 행동 공간은 이산적이다: 각 타임스텝에서 충전할지 또는 승객을 수락할지를 선택할 수 있으며, 보상 함수는 배터리 사용 부족을 방지하고 성공적인 승객 수송을 장려한다.
- 정책 학습에 트러스트 영역 정책 최적화(TRPO) 알고리즘을 사용하였으며, 두 층의 신경망과 하이퍼볼릭 tangent 활성화 함수를 사용한다.
- 훈련에는 할인 요소 0.8과 배치 크기 4096을 사용하였으며, 각 에피소드는 연속된 1주일 간의 서비스를 시뮬레이션한다.
실험 결과
연구 질문
- RQ1DRL 에이전트는 사전 지식 없이도 최적의 주행 및 충전 정책을 학습하여 단순 히وري스틱 규칙보다 뛰어난 성능을 낼 수 있는가?
- RQ2DRL 에이전트는 저에너지 가격 및 저대기 시간대에 충전함으로써 시간적·공간적 아르비트리지 기회를 활용하는가?
- RQ3고정된 배터리 임계값 기반 정책과 비교할 때 DRL 에이전트의 성능은 어떠한가?
- RQ4에이전트는 높은 서비스 가용성과 수익을 유지하면서 에너지 비용과 배출가스를 줄일 수 있는가?
- RQ5에이전트의 충전 행동 패턴은 최적의 경제적 및 환경 조건과 일치하는가?
주요 결과
- DRL 에이전트는 테스트된 모든 히وري스틱 정책보다 높은 평균 보상을 달성하여 비용 및 수익 최적화에서 뛰어난 성능을 보였다.
- 에이전트는 주로 새벽 중간 무렵과 오후 12시前后에 충전함을 학습하여 에너지 가격이 낮고 충전소 혼잡도가 적은 시간대를 선호했다.
- 에이전트는 출퇴근 정점 시간대에 충전을 피했으며, 이는 슈어지 가격 상승과 높은 승객 및 충전 수요로 인해 경제적으로 비효율적인 시기였다.
- Figure 1(b)에 나타나 있듯이, 에이전트의 마일당 비용은 히وري스틱 정책보다 유의미하게 낮아 경제적 효율성이 향상됨을 보여주었다.
- 훈련 과정에서 안정적인 학습이 이루어졌으며, 2,500 에피소드가 넘는 동안 평균 에피소드 보상이 증가하고, 변동성이 낮은 일관된 이동 평균을 유지했다.
- 에이전트의 행동은 경제적 및 환경 최적화와 일치하였으며, 고비용 및 고배출 충전 시기를 피하는 경향을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.