Skip to main content
QUICK REVIEW

[論文レビュー] Energy Management of Multi-mode Plug-in Hybrid Electric Vehicle using Multi-agent Deep Reinforcement Learning

Min Hua, Cetengfei Zhang|arXiv (Cornell University)|Mar 16, 2023
Electric Vehicles and Infrastructure被引用数 5
ひとこと要約

本稿では、二つのDDPGエージェントを協調制御するための関連比を用いたハンドシェイキング戦略を採用した、マルチモードプラグインハイブリッドエレクトリックビークル(PHEV)におけるグローバルエネルギー管理のためのマルチエージェント深層強化学習(MADRL)フレームワークを提案する。ソフトウェアインザループテストにおいて、単一エージェントDRLに比べて最大4%のエネルギー削減、ルールベースのシステムに比べて23.54%のエネルギー削減を達成した。感度解析により、学習率が学習パフォーマンスに最も大きな影響を与える要因であることが特定された。

ABSTRACT

The recently emerging multi-mode plug-in hybrid electric vehicle (PHEV) technology is one of the pathways making contributions to decarbonization, and its energy management requires multiple-input and multipleoutput (MIMO) control. At the present, the existing methods usually decouple the MIMO control into singleoutput (MISO) control and can only achieve its local optimal performance. To optimize the multi-mode vehicle globally, this paper studies a MIMO control method for energy management of the multi-mode PHEV based on multi-agent deep reinforcement learning (MADRL). By introducing a relevance ratio, a hand-shaking strategy is proposed to enable two learning agents to work collaboratively under the MADRL framework using the deep deterministic policy gradient (DDPG) algorithm. Unified settings for the DDPG agents are obtained through a sensitivity analysis of the influencing factors to the learning performance. The optimal working mode for the hand-shaking strategy is attained through a parametric study on the relevance ratio. The advantage of the proposed energy management method is demonstrated on a software-in-the-loop testing platform. The result of the study indicates that the learning rate of the DDPG agents is the greatest influencing factor for learning performance. Using the unified DDPG settings and a relevance ratio of 0.2, the proposed MADRL system can save up to 4% energy compared to the single-agent learning system and up to 23.54% energy compared to the conventional rule-based system.

研究の動機と目的

  • マルチモードPHEVにおける分離的・局所最適なMIMO制御の限界を解消すること。
  • マルチエージェント強化学習を用いて、マルチモードPHEVのグローバル最適なエネルギー管理戦略を開発すること。
  • 関連比を用いたハンドシェイキング戦略により、複数エージェントの効果的協調を実現すること。
  • 感度解析を通じて、学習パフォーマンスに影響を与える主要ハイパーパrameterを同定すること。
  • ソフトウェアインザループプラットフォーム上で提案手法を検証し、優れたエネルギー効率を示すこと。

提案手法

  • マルチモードPHEVにおけるエネルギー分配を管理するために、二つのディープデターミニスティックポリシー勾配(DDPG)エージェントを用いたマルチエージェント深層強化学習(MADRL)フレームワークを設計した。
  • エージェント間の協力を可能にするために、ハンドシェイキング戦略を導入し、関連比が相互作用の強度を制御する。
  • 学習パフォーマンスに影響を与える要因の感度解析を通じて、統一されたDDPGハイパーパrameterを確立した。
  • 最適な協調モードを特定するために、関連比をパラメトリックスタディにより最適化した。
  • リアルタイムの車両ダイナミクスとエネルギーフローをシミュレートするソフトウェアインザループプラットフォーム上で、システムを実装およびテストした。
  • フレームワークにより、複数の車両運転モードにわたる共同意思決定が可能となり、グローバルなエネルギー効率が向上した。

実験結果

リサーチクエスチョン

  • RQ1マルチインプット・マルチアウトプット(MIMO)エネルギー管理問題に、マルチエージェント深層強化学習をどのように効果的に適用できるか?
  • RQ2複雑なMIMO制御システムにおいて、複数のDDPGエージェント間の効率的協調を可能にする協調メカニズムは何か?
  • RQ3ハンドシェイキング戦略における関連比は、学習パフォーマンスおよびエネルギー効率にどのように影響を与えるか?
  • RQ4このフレームワークにおけるDDPGエージェントの学習パフォーマンスに最も大きな影響を与えるハイパーパrameterは何か?
  • RQ5提案されたMADRL手法は、単一エージェントDRLおよびルールベースのシステムに比べて、エネルギー削減の面でどの程度優れているか?

主な発見

  • DDPGエージェントの学習率が、学習パフォーマンスに最も大きな影響を与える要因であることが同定された。
  • 統一されたDDPG設定と関連比0.2を用いることで、MADRLシステムは単一エージェントDRLアプローチに比べ最大4%のエネルギー削減を達成した。
  • 提案手法は、従来のルールベースのエネルギー管理システムに比べ、最大23.54%のエネルギー消費削減を実現した。
  • 最適な関連比を用いたハンドシェイキング戦略により、二つのエージェント間の安定的かつ効率的な協調が可能になった。
  • ソフトウェアインザループテストにより、MADRLフレームワークのロバストネスとスケーラビリティが確認され、実世界のPHEV応用に適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。