Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Reinforcement Learning Framework for Eco-driving in Connected and Automated Hybrid Electric Vehicles

Zhaoxuan Zhu, Shobhit Gupta|arXiv (Cornell University)|Jan 13, 2021
Vehicle emissions and performance参考文献 45被引用数 10
ひとこと要約

本稿では、連結・自動化ハイブリッドエレクトリックビークル(HEVs)におけるエコドライブ問題を解決するため、長短記憶(LSTM)を用いた近接方策最適化(PPO)を用いた深層強化学習(DRL)フレームワークを提案する。問題を部分的に観測可能なマルコフ意思決定過程(POMDP)として定式化し、シミュレーテッド都市環境で訓練することで、DRLコントローラーは人間運転のベースラインと比較して燃料消費量を17.5%削減したが、移動時間は同等を維持した。

ABSTRACT

Connected and Automated Vehicles (CAVs), in particular those with multiple power sources, have the potential to significantly reduce fuel consumption and travel time in real-world driving conditions. In particular, the Eco-driving problem seeks to design optimal speed and power usage profiles based upon look-ahead information from connectivity and advanced mapping features, to minimize the fuel consumption over a given itinerary. In this work, the Eco-driving problem is formulated as a Partially Observable Markov Decision Process (POMDP), which is then solved with a state-of-art Deep Reinforcement Learning (DRL) Actor Critic algorithm, Proximal Policy Optimization. An Eco-driving simulation environment is developed for training and evaluation purposes. To benchmark the performance of the DRL controller, a baseline controller representing the human driver, a trajectory optimization algorithm and the wait-and-see deterministic optimal solution are presented. With a minimal onboard computational requirement and a comparable travel time, the DRL controller reduces the fuel consumption by more than 17% compared against the baseline controller by modulating the vehicle velocity over the route and performing energy-efficient approach and departure at signalized intersections, over-performing the more computationally demanding trajectory optimization method

研究の動機と目的

  • 連結・自動化ハイブリッドエレクトリックビークル(CAVs)向けに、リアルタイム性と計算効率性に優れたエコドライブコントローラーの開発。
  • 接続性および信号制御付き交差点の制約下における、高次元かつ制約付きの最適化問題、すなわち速度軌道とパワートレイン制御の統合的最適化の解決。
  • DRLポリシーを人間の行動、決定論的モデル予測制御(MPC)、および待機して最適解を求める手法と比較するためのベンチマーク。
  • 交通信号準拠、バッテリー制約、燃料効率を、スパarsely分布した高マグニチュードのペナルティで強制する報酬関数の設計。
  • 実世界への実装に適した、学習はオフライン、実行はオンラインの戦略を可能にし、搭載計算負荷を低く抑える。

提案手法

  • 交通信号や車両状態の不確実性をモデル化するため、エコドライブ問題を部分的に観測可能なマルコフ意思決定過程(POMDP)として定式化する。
  • 時間的依存性を捉えるために、関数近似器として長短記憶(LSTM)ネットワークを用いた深層強化学習(DRL)エージェントを実装し、近接方策最適化(PPO)アルゴリズムを採用する。
  • 正規化された制約ベースの成分を有する包括的な報酬関数を設計:$ r_{\text{vel}} $, $ r_{\text{batt}} $, $ r_{\text{tfc}} $, および $ r_{\text{obj}} $ で構成され、制約ペナルティは性能報酬よりも数個のオーダー大きく設定されている。
  • 高精細なシミュレーション環境においてDRLエージェントを訓練し、実際の都市部および高速道路シナリオを再現するため、やや穏やかなHEVパワートレインモデルとSUMOベースのマイクロスコピック交通シミュレーションを統合する。
  • サンプル効率性と収束安定性を向上させるために、40CPUおよび1GPUを用いた並列訓練を実施する。
  • 一般化された利得推定(GAE)とエントロピー正則化を用いた切り捨てられた時系列差分学習を適用し、ポリシーの探索性と安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1DRLベースのコントローラーは、人間運転のベースラインと同等の移動時間を維持しながら、連結・自動化ハイブリッドエレクトリックビークルで顕著な燃料節約を達成できるか?
  • RQ2実世界の走行条件下で、DRLコントローラーの性能は、人間的な行動ベースライン、決定論的MPC手法、および待機して最適解を求める手法と比較してどうなるか?
  • RQ3スパースな報酬構造を有する学習済みポリシーは、信号無視を効果的に回避し、バッテリー制約を維持できる程度まで学習できるか?
  • RQ4DRLポリシーはハイパーパrameterの変動に対してどれほど頑健か?また、PPOアルゴリズムは最小限のチューニングで安定した学習を保証するか?
  • RQ5本フレームワークは、個人の運転行動や先行車両との相互作用を含めたエコロジカルアダプティブクルーズコントロール(ACC)シナリオに拡張可能か?

主な発見

  • 100件のランダムに生成された走行ルート(都市部、ミックスド・シティ、高速道路)において、DRLコントローラーは人間運転のベースラインと比較して平均燃料消費量を17.5%削減した。
  • DRLポリシーはベースラインと同等の移動時間を維持しており、燃料効率の向上が移動時間の延長を伴わないことを示している。
  • DRLコントローラーは、より高い計算負荷を要する決定論的MPC手法よりも燃料経済性に優れていたが、搭載計算リソースは低く抑えられた。
  • 報酬関数設計において、高マグニチュードの制約ペナルティ(例:$ c_{\text{batt}} = -10 $)を用いることで、バッテリー状態および交通信号準拠が効果的に強制され、制約違反が最小限に抑えられた。
  • LSTMベースの関数近似を用いたPPOアルゴリズムは、多様な交通シナリオにおいて頑健な性能を示し、ハイパーパrameterチューニングに対してほとんど感受性を示さなかった。
  • シミュレーション環境は、信号付き交差点、地形の変化、交通ダイナミクスといった実世界の複雑さを効果的に再現できており、信頼性の高いポリシーの訓練と評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。