Skip to main content
QUICK REVIEW

[論文レビュー] A Reinforcement Learning Approach for Electric Vehicle Routing Problem with Vehicle-to-Grid Supply

Ajay Narayanan, Prasant Misra|arXiv (Cornell University)|Apr 12, 2022
Electric Vehicles and Infrastructure被引用数 9
ひとこと要約

本稿では、容量制約、時間窓、および電力網への電力還送(V2G)を組み合わせた電動配送車両ルーティング問題(CEVRPTW-D)を解くための強化学習(RL)ベースのフレームワークであるQuikを提案する。このフレームワークは、需要ピーク時に電力網に電力を供給可能な配送ルート最適化を実現する。Quikは、MILPおよび遺伝的アルゴリズム(GA)のベースラインと比較して24倍高速な計算を達成し、最適解からの差異が20%以内に収まるため、大規模なEVフリートにおけるスケーラブルかつリアルタイムのルーティングが可能であることを示している。

ABSTRACT

The use of electric vehicles (EV) in the last mile is appealing from both sustainability and operational cost perspectives. In addition to the inherent cost efficiency of EVs, selling energy back to the grid during peak grid demand, is a potential source of additional revenue to a fleet operator. To achieve this, EVs have to be at specific locations (discharge points) during specific points in time (peak period), even while meeting their core purpose of delivering goods to customers. In this work, we consider the problem of EV routing with constraints on loading capacity; time window; vehicle-to-grid energy supply (CEVRPTW-D); which not only satisfy multiple system objectives, but also scale efficiently to large problem sizes involving hundreds of customers and discharge stations. We present QuikRouteFinder that uses reinforcement learning (RL) for EV routing to overcome these challenges. Using Solomon datasets, results from RL are compared against exact formulations based on mixed-integer linear program (MILP) and genetic algorithm (GA) metaheuristics. On an average, the results show that RL is 24 times faster than MILP and GA, while being close in quality (within 20%) to the optimal.

研究の動機と目的

  • 最終一里の電動車両(EV)配送の高コストおよび高複雑性を低減するため、収益源としての車両から電力網へのエネルギー供給(V2G)を統合することを目的とする。
  • 容量制約、時間窓制約、およびV2G放電制約を満たす条件下で、EVの配送ルートを最適化し、総移動コストを最小化するCEVRPTW-D問題をモデル化・解明することを目的とする。
  • 大規模なEVルーティングに伴うマルチサービス運用を伴う場合に、正確な手法(MILP)およびメタヒューリスティック(GA)のスケーラビリティの限界を克服することを目的とする。
  • オフライン学習を通じて効率的なルーティング方策を学習できる価値ベースのRLフレームワークを設計し、フリート運用者によるリアルタイム意思決定を可能とすることを目的とする。

提案手法

  • RLエージェントは、システムの状態を表す、車両と顧客、および車両と放電ステーションのペairをエンコードした状態を観測する。
  • 状態空間には、車両の積載量、時刻、位置、およびエネルギー残量が含まれる。行動空間は、次の訪問先(顧客または放電ステーション)を選択することを含む。
  • 移動コストを反映するように設計されたカスタム報酬関数が採用され、V2G放電時のエネルギー売却収益と時間窓違反に対するペナルティが組み込まれている。
  • 状態から行動への方策を学習する価値ベースのRLアルゴリズム(例:Deep Q-Networkまたは類似手法)を用いて、累積割引報酬を最大化する方策を学習する。
  • モデルは、多様な顧客および放電ステーションの配置をカバーできるように、Solomonベンチマークデータセットを用いてオフラインで学習される。
  • 計算時間および解のコストを主な指標として、MILP(正確な手法)およびGA(メタヒューリスティック)ベースラインと比較して性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1強化学習は、容量制約および時間窓制約の下で、物資配送とV2Gエネルギー供給を統合する多目的CEVRPTW-D問題を効果的に解けるか?
  • RQ2大規模なEVルーティング(数百人の顧客および放電ポイントを含む)において、RLベースの手法は、従来のMILPおよびGA手法と比較して、計算効率がどの程度優れているか?
  • RQ3特に複雑な運用制約下でも、RLによる解は、最適なMILP解と比較して、コスト面でどの程度の品質を維持できるか?
  • RQ4変動する需要および電力料金に応じた動的環境において、RLフレームワークはリアルタイムでの展開にスケーラブルか?

主な発見

  • Quikは、数百人の顧客および放電ステーションを含む大規模なインスタンスにおいて、MILPおよび遺伝的アルゴリズム(GA)ベースラインと比較して平均して24倍の高速な計算速度を達成した。
  • RLベースの解は、MILPによる最適コストから約20%以内の差異に収まり、優れた近似最適性を示している。
  • フレームワークは、配送スケジュールに影響を与えることなく、V2Gエネルギー放電をルーティング意思決定に効果的に統合し、EVがピーク時の電力需要時に収益を生み出すことを可能にした。
  • 価値ベースのRLアプローチは、正確な手法およびメタヒューリスティック手法の計算ボトル neck を克服し、大規模な問題インスタンスに対しても効率的にスケーリングできた。
  • 報酬設計戦略は、配送コスト、時間窓遵守、エネルギー収益のバランスをうまく取ることができ、エージェントがコスト効率の高い方策を学習するのを支援した。
  • 予備的な結果から、さらなるRLモデルの改善により、最適性ギャップを縮小しつつ、動的需要へのリアルタイム適応を可能にする可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。