Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Taxi Carpool Policies via Reinforcement Learning and Spatio-Temporal Mining

Ishan Jindal, Zhiwei Qin|arXiv (Cornell University)|Nov 11, 2018
Transportation and Mobility Innovations参考文献 23被引用数 4
ひとこと要約

本稿では、交通効率の向上を目的として、空間的・時間的特徴を有するニューラルネットワーク(ST-NN)と強化学習(RL)フレームワークを組み合わせたタクシー・カープール政策最適化手法を提案する。ST-NNは特徴工学を必要とせず、生のGPSデータから直接移動時間と距離を予測する。一方、RLエージェントは、効果的な移動距離を最大化するために、カープール依頼を受け入れるタイミングを学習する。本手法は、固定方針およびテーブル型Q方針を上回り、特にウプタウン・マンハタンのような低需要地域において、長期的な効率性が向上し、混雑が軽減される。

ABSTRACT

In this paper, we develop a reinforcement learning (RL) based system to learn an effective policy for carpooling that maximizes transportation efficiency so that fewer cars are required to fulfill the given amount of trip demand. For this purpose, first, we develop a deep neural network model, called ST-NN (Spatio-Temporal Neural Network), to predict taxi trip time from the raw GPS trip data. Secondly, we develop a carpooling simulation environment for RL training, with the output of ST-NN and using the NYC taxi trip dataset. In order to maximize transportation efficiency and minimize traffic congestion, we choose the effective distance covered by the driver on a carpool trip as the reward. Therefore, the more effective distance a driver achieves over a trip (i.e. to satisfy more trip demand) the higher the efficiency and the less will be the traffic congestion. We compared the performance of RL learned policy to a fixed policy (which always accepts carpool) as a baseline and obtained promising results that are interpretable and demonstrate the advantage of our RL approach. We also compare the performance of ST-NN to that of state-of-the-art travel time estimation methods and observe that ST-NN significantly improves the prediction performance and is more robust to outliers.

研究の動機と目的

  • 都市部のタクシーシステムにおける交通効率を最大化し、交通渋滞を最小化するデータ駆動型カープール政策の開発を目的とする。
  • 生のGPSデータを用いて、動的な都市環境における正確な移動時間および距離の推定を実現する課題に取り組む。
  • リアルタイムのドライバー状態と将来の需要見通しに基づいて、最適なカープール受入意思決定を学習する強化学習フレームワークを設計する。
  • マンハタンの異なる都市地域における需要密度の違いを考慮し、固定方針およびテーブル型Q方針と比較して、RL方針の性能を評価する。
  • ST-NNモデルが手動による特徴工学を必要とせず、移動時間および距離を予測する際の精度と頑健性を示す、スケーラビリティと耐久性の優れた性能を実証する。

提案手法

  • 出発地および到着地の生のGPS座標と時刻を入力として受け取り、経路や地図の構築を不要とする空間的・時間的特徴を有するニューラルネットワーク(ST-NN)を開発し、移動時間と距離を予測する。
  • NYCタクシー移動データを用いてカープールシミュレーション環境を構築し、ST-NNが移動時間の推定値を提供し、RLエージェントが状態遷移に基づいて行動を選択する。
  • カープール意思決定問題をマーカフ連鎖過程(MDP)として定式化し、1回の移動あたりの効果的距離を報酬として定義することで、より高い効率性と混雑の低減を促進する。
  • 長期的な累積報酬を最大化するために、各意思決定ポイントでカープール依頼を受け入れるかどうかを学習するため、ディープQネットワーク(DQN)エージェントを訓練する。
  • 学習の安定化と収束の改善のため、ミニバッチ経験再生とターゲットネットワークをDQN訓練に用いる。
  • DQN方針を、常に受ける(固定方針)およびテーブル型Q学習方針と比較し、マンハタンのさまざまな需要状況における性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1生のGPSデータを用いてトレーニングされたディープラーニングモデルは、地図や経路情報がなくても、移動時間および距離を正確に予測できるか?
  • RQ2シミュレートされたタクシー移動データに基づいてトレーニングされた強化学習エージェントは、固定方針に比べ、効果的な移動距離と混雑低減の観点で優れたカープール方針を学習できるか?
  • RQ3需要密度が異なる地域、例えばウプタウンとダウンタウン・マンハタンのような地域において、RL方針の性能はどのように変化するか?
  • RQ4ST-NNモデルは、最先端の移動時間推定手法と比較して、予測精度および外れ値に対する頑健性をどの程度向上させるか?
  • RQ5特に低需要地域において、短い報酬を犠牲にして長期的な利益を得るために、RLエージェントは戦略的に高価値領域へ移動する能力を学習できるか?

主な発見

  • ウプタウン・マンハタンにおいて、DQNで学習された方針は固定方針およびテーブル型Q方針を上回り、平日では平均累積報酬46.08、週末では27.86を達成したのに対し、固定方針はそれぞれ41.543および25.39であった。
  • タクシー需要が高いため、ダウンタウン・マンハトンではDQN方針は固定方針とほぼ同等の性能を示した(平日339.42 vs. 340.06)、これは、常にカープールを受け入れることが密度の高い地域ではほぼ最適であることを示している。
  • ST-NNモデルは、手動による特徴工学を必要とせず、最先端の移動時間推定手法と比較して、予測精度および外れ値に対する頑健性の両面で顕著に優れていた。
  • DQNエージェントは、特にウプタウンのような低需要地域において、即時の報酬を犠牲にして、将来の高いQ値を持つ領域へ向かう戦略的移動を学習し、カープール依頼を選択的に受けるようになった。
  • テーブル型Q方針は、膨大な状態行動空間にわたるQ値を維持することが現実的でなく、テスト時にQ値テーブルが疎になり、頻繁に0値の予測が行われるため、最も悪い性能を示した。
  • ウプタウン・マンハタンでは、DQN方針は午後から固定方針とは乖離し、将来の高価値状態にアクセスするために、即時のピックアップを戦略的に遅らせるようになり、知的な長期的計画を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。