[論文レビュー] Increasing performance of electric vehicles in ride-hailing services using deep reinforcement learning
本稿では、信頼領域方策最適化(TRPO)を用いた深層強化学習(DRL)アプローチを提案し、ライドシェアリング電気自動車(EV)の走行および充電ポリシーを最適化することで、エネルギー費用と排出ガスを削減する。DRLエージェントは、エネルギー価格と混雑度が低いピーク時以外の時間帯に充電することを学習し、報酬を最大化するとともに、1マイルあたりのコストを低く抑えることで、ヒューリスティックなポリシーを上回る性能を発揮した。
New forms of on-demand transportation such as ride-hailing and connected autonomous vehicles are proliferating, yet are a challenging use case for electric vehicles (EV). This paper explores the feasibility of using deep reinforcement learning (DRL) to optimize a driving and charging policy for a ride-hailing EV agent, with the goal of reducing costs and emissions while increasing transportation service provided. We introduce a data-driven simulation of a ride-hailing EV agent that provides transportation service and charges energy at congested charging infrastructure. We then formulate a test case for the sequential driving and charging decision making problem of the agent and apply DRL to optimize the agent's decision making policy. We evaluate the performance against hand-written policies and show that our agent learns to act competitively without any prior knowledge.
研究の動機と目的
- ライドシェアリングEVの運用上の課題、すなわち走行距離制限、長時間の充電時間、変動するエネルギー価格および需要に対処すること。
- 動的エネルギー価格、排出ガス、サージプライシング、充電ステーションの待ち行列といった現実世界の要因をモデル化するデータ駆動型のシミュレーション環境を構築すること。
- 事前の知識なしに最適な走行および充電ポリシーを学習できるDRLエージェントを訓練し、コスト効率とサービスパフォーマンスを向上させること。
- DRLエージェントのパフォーマンスを、手作業で設計されたしきい値ベースのポリシーと比較し、実世界に近い条件下での優位性を評価すること。
- 個々のEVエージェントの最適化にDRLを用いる可能性を示し、スケーラブルなファミリー規模の応用への道筋を示すこと。
提案手法
- 研究では、EVの意思決定プロセスをマーカフ連鎖意思決定過程(MDP)として定式化し、状態観測値としてバッテリー残容量、時刻、予想される充電コスト、排出ガス、待ち時間の合計を含める。
- OpenAI Gymを用いてカスタムのシミュレーション環境を構築し、120の空間的ゾーン、100kWhのバッテリー容量、100kWの充電ステーションを備えたマンハッタンベースのライドシェアリングサービスをシミュレートする。
- 環境はカリフォルニア州の時間変動型電力グリッドデータ(時間単位のエネルギー価格およびCO₂排出量)をモデル化し、乗車の生成には実際のNYCタクシーの乗車データを用いる。
- エージェントの行動空間は離散的であり、各タイムステップで充電するか、乗車を受けるかを選択する。報酬関数は、バッテリーの未利用を罰するもので、成功した乗車には報酬が与えられる。
- 信頼領域方策最適化(TRPO)アルゴリズムを用いてポリシーを訓練し、2層のニューラルネットワークと双曲正接活性化関数を用いる。
- 学習には割引率0.8とバッチサイズ4096を用い、各エピソードは1週間の連続的なサービスをシミュレートする。
実験結果
リサーチクエスチョン
- RQ1DRLエージェントは、事前の知識なしに、ライドシェアリングEVの最適な走行および充電ポリシーを学習できるか。また、単純なヒューリスティックなルールを上回る性能を示せるか。
- RQ2DRLエージェントは、エネルギー価格が低く、待ち行列が少ない時期に、時間的・空間的アービタージュの機会を活用して充電を学習するか。
- RQ3DRLエージェントのパフォーマンスは、固定バッテリーしきい値に基づいて充電する手作業のポリシーと比較して、どのように異なるか。
- RQ4エージェントは、高いサービス可用性と収益を維持しながら、エネルギー費用と排出ガスを低減できるか。
- RQ5エージェントの充電行動のパターンはどのようなものか。また、経済的・環境的最適条件と整合しているか。
主な発見
- DRLエージェントは、テストされたすべてのヒューリスティックポリシーを上回る平均報酬を達成し、コストと収益最適化の面で優れたパフォーマンスを示した。
- エージェントは、エネルギー価格が低く、充電ステーションの混雑度が低い深夜の真ん中および正午前後を中心に充電を行うことを学習した。
- エージェントは、サージプライシングと乗車・充電ステーション需要が高いため経済的に非効率な通勤ピーク時を避けて充電を行った。
- 図1(b)に示すように、エージェントの1マイルあたりのコストは、ヒューリスティックポリシーのそれよりも顕著に低く、経済的効率の向上が示された。
- 学習プロセスは安定しており、2,500エピソードを超えて平均エピソード報酬が上昇し、変動が小さい一貫した移動平均を示した。
- エージェントの行動は、経済的および環境的最適化と整合しており、高コスト・高排出ガスの充電時期を避けていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。