Skip to main content
QUICK REVIEW

[論文レビュー] Human-like Energy Management Based on Deep Reinforcement Learning and Historical Driving Experiences

Chen, Hao, Xiaolin Tang|arXiv (Cornell University)|Jul 16, 2020
Electric and Hybrid Vehicle TechnologiesEngineering参考文献 31被引用数 18
ひとこと要約

本稿では、熟練ドライバーの走行データを用いてトレーニングされた深層強化学習(DDPG)を用いて、シリーズ・パarallelハイブリッド電気自動車(HEV)向けに人間らしく効率的なエネルギー管理戦略(EMS)を提案する。動的プログラミング(DP)に基づくエキスパートデモンストレーションの代わりに、実際の走行パターンを用いることで、燃料効率が向上し、収束速度も速くなる一方で、近似的最適性能を維持することができる。

ABSTRACT

Development of hybrid electric vehicles depends on an advanced and efficient energy management strategy (EMS). With online and real-time requirements in mind, this article presents a human-like energy management framework for hybrid electric vehicles according to deep reinforcement learning methods and collected historical driving data. The hybrid powertrain studied has a series-parallel topology, and its control-oriented modeling is founded first. Then, the distinctive deep reinforcement learning (DRL) algorithm, named deep deterministic policy gradient (DDPG), is introduced. To enhance the derived power split controls in the DRL framework, the global optimal control trajectories obtained from dynamic programming (DP) are regarded as expert knowledge to train the DDPG model. This operation guarantees the optimality of the proposed control architecture. Moreover, the collected historical driving data based on experienced drivers are employed to replace the DP-based controls, and thus construct the human-like EMSs. Finally, different categories of experiments are executed to estimate the optimality and adaptability of the proposed human-like EMS. Improvements in fuel economy and convergence rate indicate the effectiveness of the constructed control structure.

研究の動機と目的

  • 熟練ドライバーの走行行動を模倣するリアルタイムで実行可能な、人間らしさのあるエネルギー管理戦略(EMS)をHEV向けに開発すること。
  • 従来の動的プログラミング(DP)に基づくエキスパートデモンストレーションを、実際の履歴走行データに置き換えることで、現実性と適応性を高めること。
  • 最適性を損なわず、燃料効率と収束速度を向上させること。
  • 実世界のデータを用いて、多様な走行条件下での提案されたDRLベースのEMSの妥当性を検証すること。

提案手法

  • シミュレーション環境として、制御指向のシリーズ・パラレルハイブリッドパワートレインモデルを構築する。
  • 最適なパワースプリットポリシーを学習するために、深層決定的方策勾配(DDPG)アルゴリズムを採用する。
  • 熟練ドライバーの履歴走行データを用いて、DPソリューションに依存せずエキスパートデモンストレーションを生成する。
  • DDPGエージェントを、人間が運転した軌道データを用いてトレーニングし、人間らしさのある制御行動を学習する。
  • 履歴データに示された高品質な行動を活用することで、近似的最適性を確保する。
  • さまざまな走行サイクルで訓練済みポリシーを評価し、適応性と性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1実際のドライバー走行データでトレーニングされたDRLベースのエネルギー管理システムは、動的プログラミング(DP)と同等の燃料効率を達成できるか。また、リアルタイム適用可能であるか。
  • RQ2DPに基づくエキスパートデモンストレーションを実際のドライバー走行データに置き換えると、DRLポリシーの収束速度とロバスト性にどのような影響を与えるか。
  • RQ3人間らしさのある制御行動は、多様な走行条件下でのEMSの適応性をどの程度向上させるか。
  • RQ4提案手法は、人間の走行パターンから学習しながらも、近似的最適な性能を維持できるか。

主な発見

  • 提案された人間らしさのあるEMSは、動的プログラミングで得られるグローバル最適に非常に近い燃料効率を達成した。
  • 履歴走行データでトレーニングされたDRLエージェントは、エキスパートデモンストレーションなしの従来のDRL手法よりも高速に収束した。
  • 異なる走行サイクルにおいても、強い汎化能力を示した。
  • DPに基づく軌道ではなく、実際のドライバー走行データを用いることで、より現実的で実用的な制御ポリシーが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。