Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Dynamic Urban Transportation Problems

Laura Luise Schultz, Vadim Sokolov|arXiv (Cornell University)|Jun 14, 2018
Traffic control and management参考文献 37被引用数 10
ひとこと要約

本稿では、深層学習メタモデルを用いて複雑なシミュレータのダイナミクスを近似することで、計算コストを低減する深層強化学習(DRL)フレームワークを提案する。交通割り当て問題においてDQNベースの需要再ルーティングを実施し、システム全体の移動時間に51%の改善を達成した。実世界のシミュレーションデータを用いた検証により、本手法の有効性が裏付けられた。

ABSTRACT

We explore the use of deep learning and deep reinforcement learning for optimization problems in transportation. Many transportation system analysis tasks are formulated as an optimization problem - such as optimal control problems in intelligent transportation systems and long term urban planning. Often transportation models used to represent dynamics of a transportation system involve large data sets with complex input-output interactions and are difficult to use in the context of optimization. Use of deep learning metamodels can produce a lower dimensional representation of those relations and allow to implement optimization and reinforcement learning algorithms in an efficient manner. In particular, we develop deep learning models for calibrating transportation simulators and for reinforcement learning to solve the problem of optimal scheduling of travelers on the network.

研究の動機と目的

  • 大規模都市交通システムにおけるシミュレーションベース最適化の高い計算コストに対処すること。
  • 交通シミュレータの高次元入出力関係に内在する低次元パターンを捉える深層学習ベースのメタモデルを開発すること。
  • ニューラルネットワーク関数近似を用いた深層強化学習を、動的交通制御およびスケジューリング問題に適用すること。
  • ベイジアン法やフィルタリング手法と比較して、シミュレータキャリブレーションにおけるサンプル効率を向上させること。
  • DRLが動的交通割り当ておよびシステム全体の移動時間最適化において有効であることを実証すること。

提案手法

  • 複雑で確率的な交通シミュレータの入出力マッピングを近似するための深層ニューラルネットワークを訓練し、効率的な最適化を可能にする。
  • 従来のアクティブサブスペース手法に代わる、組み合わせ的ニューラルネットワークを用いて次元削減を実現する。
  • 状態は現在および保留中の需要で定義され、時間帯ごとの最適な需要再ルーティング方針を学習するため、Deep Q-Network(DQN)を用いる。
  • 行動空間では、時間帯間で0〜2単位の需要を移動させる、または代替経路に再ルーティングする操作を許容する。
  • 報酬関数は、シミュレータ内での反復的フランク=ホープ・均衡ソルバーを用いて計算される、負の合計システム移動時間である。
  • DQNは24時間分の需要シーケンスを100エピソードにわたり訓練し、未学習の需要パターンに対する性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1深層学習メタモデルは、複雑な交通シミュレータの入出力関係の次元を効果的に低減できるか?
  • RQ2シミュレータキャリブレーションにおいて、ベイジアン法やフィルタリング手法と比較して、深層学習ベースのメタモデルはサンプル効率に優れているか?
  • RQ3関数近似を用いた深層強化学習は、従来手法と比較して、動的交通割り当て問題をより効果的に解けるか?
  • RQ4DQNベースの需要再ルーティングは、シミュレートされた都市ネットワークにおけるシステム全体の移動時間にどのような影響を与えるか?
  • RQ524時間スケジューリング予定期間において、DQNポリシーは訓練時に見なかった未確認の需要パターンに対し、どの程度一般化できるか?

主な発見

  • 深層学習メタモデルは、ベイジアン法やフィルタリング手法と比較して、交通シミュレータキャリブレーションにおいて優れたサンプル効率を達成した。
  • DQNベースのポリシーは、元の需要分布と比較して、合計システム移動時間を51%削減した。
  • 最適ポリシーは、ピーク時間帯に一貫して1〜2単位の需要を主要経路(1→2)から代替経路(1→3)に再ルーティングしており、特に14〜24時帯に顕著であった。
  • DQNポリシーは優れた一般化性能を示し、学習時に見なかったランダムに生成された需要パターンに対しても効果的に対処できた。
  • 次元削減に組み合わせ的ニューラルネットワークを用いることで、入力パrameter空間の探索がより効率的に行えた。
  • 実験的結果から、理論的最悪ケース収束限界は、交通分野におけるDRL実装で実際に観察される高速収束を反映していないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。