Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Ridesharing Dispatch Using Multi-Agent Reinforcement Learning

Oscar Lima, Hansal Shah|arXiv (Cornell University)|Jun 18, 2020
Transportation and Mobility Innovations参考文献 29被引用数 5
ひとこと要約

本稿では、Q値混合(QMIX)を用いたマルチエージェント強化学習手法を提案し、中央集権的訓練と分散型実行を組み合わせることで、乗車完了速度の向上と一般化性能の向上を実現するリヤーシアリングディスパッチの効率化を図る。固定および可変サイズのグリッドにおいて、IDQNおよびグリーディーベースラインを上回り、大規模な地図において平均待機時間を最大20.3%まで短縮する。

ABSTRACT

With the advent of ride-sharing services, there is a huge increase in the number of people who rely on them for various needs. Most of the earlier approaches tackling this issue required handcrafted functions for estimating travel times and passenger waiting times. Traditional Reinforcement Learning (RL) based methods attempting to solve the ridesharing problem are unable to accurately model the complex environment in which taxis operate. Prior Multi-Agent Deep RL based methods based on Independent DQN (IDQN) learn decentralized value functions prone to instability due to the concurrent learning and exploring of multiple agents. Our proposed method based on QMIX is able to achieve centralized training with decentralized execution. We show that our model performs better than the IDQN baseline on a fixed grid size and is able to generalize well to smaller or larger grid sizes. Also, our algorithm is able to outperform IDQN baseline in the scenario where we have a variable number of passengers and cars in each episode. Code for our paper is publicly available at: https://github.com/UMich-ML-Group/RL-Ridesharing.

研究の動機と目的

  • 高次元の状態空間と行動空間を有する動的な都市環境における、効率的なリヤーシアリングディスパッチの課題に対処すること。
  • 独立的Qネットワーク(IDQN)のような分散型マルチエージェント強化学習手法が、同時に学習するための非定常性に起因する不安定性を克服すること。
  • エピソードごとに乗客および車両の数が変動する状況において、異なるグリッドサイズに一般化できるようにすること。
  • ディスパッチ意思決定に先着順(FCFS)優先順位機構を組み込むことで、乗客の待機時間を短縮すること。
  • 現実的なリヤーシアリングシナリオにおいて、分散型実行を伴うQMIXベースの訓練が優れた性能とスケーラビリティを示すことを実証すること。

提案手法

  • QMIXは、個々のエージェントのQ値の単調関数として定義されるグローバル価値関数を学習することで、中央集権的訓練と分散型実行を可能にするマルチエージェント強化学習アルゴリズムを用いる。
  • 個々のQ値の非線形かつ単調な組み合わせを用いて連合行動価値を推定し、エージェント間での一貫性のある方策最適化を保証する。
  • 動的な乗客リクエストと車両の移動を伴うグリッドワールドとしてリヤーシアリング環境をモデル化し、乗客待機時間を短縮するために先着順(FCFS)優先ルールを適用する。
  • 経験再生とターゲットネットワークを用いて学習を安定化させる深層Qネットワークを用いてエージェントを訓練するが、推論時には個別に行動選択を維持する。
  • カリキュラム学習を適用し、100×100グリッドで学習を行い、10×10(小)および500×500(大)グリッドへの一般化性能を評価する。
  • RLPyTを用いて構築されたシミュレーション環境により、同一条件下で複数のアルゴリズムの訓練と評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1固定グリッドサイズおよび固定エージェント数の下で、QMIXベースのマルチエージェントRLアプローチは、独立的Qネットワーク(IDQN)を上回る性能を示すか?
  • RQ2訓練時に使用したグリッドサイズとは異なるサイズ(小および大)のグリッドに、QMIXモデルは効果的に一般化できるか?
  • RQ3エピソードごとに乗客および車両の数が変動する状況では、モデルの性能はいかがなっているか?
  • RQ4ディスパッチ方策に先着順(FCFS)優先順位機構を統合することで、乗客の待機時間が短縮されるか?
  • RQ5QMIXにおける中央集権的訓練と分散型実行は、IDQNベースの手法に見られる非定常性問題をどのように緩和するか?

主な発見

  • 100×100グリッドで乗客10名、車両10台の固定状況下で、QMIXは平均待機時間を195.66にまで短縮し、IDQN(199.43)、グリーディ(201.85)、ランダム(209.03)を上回った。
  • 500×500グリッドで乗客25名、車両20台の状況下で、QMIXは待機時間を12,812.79にまで短縮し、グリーディーベースライン(13,871.07)を8.3%改善した。
  • 100×100グリッドで学習したモデルを10×10グリッド(乗客7名、車両2台)に一般化した場合、QMIXはグリーディーより9.2%優れており、一般化されたIDQNより2.3%優れていた。
  • 500×500グリッドで乗客25名、車両20台の状況下で、QMIXはグリーディーより20.3%、IDQNより12.7%の待機時間短縮を達成した。
  • QMIXは、IDQNと比較してほぼすべての設定でより優れた一般化性能を示し、IDQNより2.5%以上遅くなるケースは一切なかった。
  • 変動するエージェント数の状況でも、強固な性能を維持しており、動的なリヤーシアリングシナリオにおける耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。