[논문 리뷰] Energy Management of Multi-mode Plug-in Hybrid Electric Vehicle using Multi-agent Deep Reinforcement Learning
이 논문은 다중 모드 플러그인 하이브리드 전기차(PHEV)의 글로벌 에너지 관리에 대해 다중 에이전트 딥 강화학습(MADRL) 프레임워크를 제안한다. 수동적 협력 전략과 관련도 비율을 사용하여 두 개의 DDPG 에이전트를 조율한다. 소프트웨어 인 더 루프 테스트에서 단일 에이전트 DRL 대비 최대 4%의 에너지 절감과 룰 기반 시스템 대비 23.54%의 절감을 달성하며, 민감도 분 析를 통해 학습률이 가장 영향력 있는 요소로 규명되었다.
The recently emerging multi-mode plug-in hybrid electric vehicle (PHEV) technology is one of the pathways making contributions to decarbonization, and its energy management requires multiple-input and multipleoutput (MIMO) control. At the present, the existing methods usually decouple the MIMO control into singleoutput (MISO) control and can only achieve its local optimal performance. To optimize the multi-mode vehicle globally, this paper studies a MIMO control method for energy management of the multi-mode PHEV based on multi-agent deep reinforcement learning (MADRL). By introducing a relevance ratio, a hand-shaking strategy is proposed to enable two learning agents to work collaboratively under the MADRL framework using the deep deterministic policy gradient (DDPG) algorithm. Unified settings for the DDPG agents are obtained through a sensitivity analysis of the influencing factors to the learning performance. The optimal working mode for the hand-shaking strategy is attained through a parametric study on the relevance ratio. The advantage of the proposed energy management method is demonstrated on a software-in-the-loop testing platform. The result of the study indicates that the learning rate of the DDPG agents is the greatest influencing factor for learning performance. Using the unified DDPG settings and a relevance ratio of 0.2, the proposed MADRL system can save up to 4% energy compared to the single-agent learning system and up to 23.54% energy compared to the conventional rule-based system.
연구 동기 및 목표
- 다중 모드 PHEV에서 분리된 국소 최적의 MIMO 제어 방식의 한계를 해결하기 위해.
- 다중 에이전트 강화학습을 활용해 다중 모드 PHEV의 글로벌 최적 에너지 관리 전략을 개발하기 위해.
- 수동적 협력 전략과 관련도 비율을 통해 다수의 에이전트를 효과적으로 조율하기 위해.
- 민감도 분 析를 통해 학습 성능에 영향을 주는 주요 하이퍼파rameter를 규명하기 위해.
- 소프트웨어 인 더 루프 플랫폼에서 제안된 방법을 검증하고 뛰어난 에너지 효율성을 입증하기 위해.
제안 방법
- 다중 모드 PHEV의 에너지 분배를 관리하기 위해 두 개의 딥 디터미니스틱 정책 그래디언트(DDPG) 에이전트를 사용하는 다중 에이전트 딥 강화학습(MADRL) 프레임워크를 설계하였다.
- 에이전트 간 협업을 가능하게 하기 위해 수동적 협력 전략을 도입하였으며, 상호작용 강도를 제어하기 위해 관련도 비율을 사용하였다.
- 학습 성능에 영향을 주는 요인들의 민감도 분 析를 통해 통합된 DDPG 하이퍼파rameter를 설정하였다.
- 최적의 협업 모드를 도출하기 위해 관련도 비율을 변수로 하는 정량적 연구를 수행하였다.
- 실시간 차량 동역학과 에너지 흐름을 시뮬레이션하는 소프트웨어 인 더 루프 플랫폼에서 시스템을 구현하고 테스트하였다.
- 프레임워크는 다수의 차량 운전 모드 간 통합된 의사결정을 가능하게 하여 글로벌 에너지 효율성을 향상시켰다.
실험 결과
연구 질문
- RQ1다중 입력 다중 출력(MIMO) 에너지 관리 문제에 대해 다중 에이전트 딥 강화학습을 어떻게 효과적으로 적용할 수 있는가?
- RQ2복잡한 MIMO 제어 시스템에서 다수의 DDPG 에이전트 간 효율적인 협업을 가능하게 하는 조율 메커니즘은 무엇인가?
- RQ3수동적 협력 전략에서의 관련도 비율은 학습 성능과 에너지 효율성에 어떤 영향을 미치는가?
- RQ4이 프레임워크에서 DDPG 에이전트의 학습 성능에 가장 큰 영향을 주는 하이퍼파rameter는 무엇인가?
- RQ5제안된 MADRL 방법은 단일 에이전트 DRL 및 룰 기반 시스템에 비해 에너지 절감 측면에서 어느 정도 뛰어나게 성능을 발휘하는가?
주요 결과
- DDPG 에이전트의 학습률이 학습 성능에 가장 영향력 있는 요소로 규명되었다.
- 통합된 DDPG 설정과 관련도 비율 0.2를 사용할 경우, 단일 에이전트 DRL 대비 최대 4%의 에너지 절감을 달성하였다.
- 제안된 방법은 기존의 룰 기반 에너지 관리 시스템 대비 최대 23.54%의 에너지 소비 감소를 이룩하였다.
- 최적의 관련도 비율을 가진 수동적 협력 전략은 두 에이전트 간 안정적이고 효율적인 조율을 가능하게 하였다.
- 소프트웨어 인 더 루프 테스트를 통해 MADRL 프레임워크의 강건성과 실세계 PHEV 응용에 대한 확장 가능성이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.