Skip to main content
QUICK REVIEW

[論文レビュー] ModelLight: Model-Based Meta-Reinforcement Learning for Traffic Signal Control

Xingshuai Huang, Di Wu|arXiv (Cornell University)|Nov 15, 2021
Traffic control and management参考文献 40被引用数 11
ひとこと要約

ModelLightは、合成遷移を生成するためにニューラルネットワーク動的モデルのアンサンブルを用いるモデルベースのメタ強化学習フレームワークを提案する。これにより、実世界の環境との相互作用を最小限に抑えながら、データ効率を向上させ、より速い方策学習を実現する。わずか10ラウンドの訓練で、100ラウンド訓練されたMetaLightを上回る最先端の性能を達成する。

ABSTRACT

Traffic signal control is of critical importance for the effective use of transportation infrastructures. The rapid increase of vehicle traffic and changes in traffic patterns make traffic signal control more and more challenging. Reinforcement Learning (RL)-based algorithms have demonstrated their potential in dealing with traffic signal control. However, most existing solutions require a large amount of training data, which is unacceptable for many real-world scenarios. This paper proposes a novel model-based meta-reinforcement learning framework (ModelLight) for traffic signal control. Within ModelLight, an ensemble of models for road intersections and the optimization-based meta-learning method are used to improve the data efficiency of an RL-based traffic light control method. Experiments on real-world datasets demonstrate that ModelLight can outperform state-of-the-art traffic light control algorithms while substantially reducing the number of required interactions with the real-world environment.

研究の動機と目的

  • 実世界の交通信号制御におけるモデルフリー強化学習の高いサンプル複雑性に対処する。これは、広範な実環境との相互作用が現実的ではないためである。
  • モデルベース強化学習とメタラーニングを組み合わせることで、新しい交差点への迅速な適応を実現する交通信号制御におけるデータ効率の向上を図る。
  • 学習済みの動的モデルによって生成された合成経験を通じて、実世界の相互作用への依存を軽減し、大規模な実世界訓練の必要性を低減する。
  • 単一のグローバルモデルではなく、ニューラルネットワークモデルのアンサンブルを用いることで、動的モデル化におけるモデルバイアスに対する耐性を高める。
  • 限られた訓練データでも、多様な交差点タイプに迅速に適応できる方策の初期化をメタラーニングによって実現する。

提案手法

  • 交通状態遷移をシミュレートするため、ニューラルネットワークベースの動的モデルのアンサンブルを訓練し、方策学習のための合成(仮想的)ロールアウトを生成する。
  • 多様で低誤差の合成軌道を生成するため、ランダムな初期状態を用いた短いロールアウトを用いることで、モデル誤差の累積を軽減する。
  • MAMLを用いたメタラーニングにより、新しい交差点において最小限の実環境相互作用で迅速にファインチューニング可能な最適な方策初期化を学習する。
  • 方策学習中にQ関数を近似するためにFRAP++ネットワークを用い、サンプル効率と安定性を向上させる。
  • モデルベースのロールアウトとメタ強化学習を統合することで、実環境との相互作用への依存を低減しながら、高い性能を維持する。
  • ハイパーパramータのアブレーションスタディを実施し、ロールアウト長、モデルアーキテクチャ(例:LSTM対全結合層)およびアンサンブルサイズを最適化する。

実験結果

リサーチクエスチョン

  • RQ1モデルベースのメタ強化学習フレームワークは、効果的な交通信号制御に必要な実世界の環境との相互作用回数を顕著に削減できるか?
  • RQ2単一のグローバルモデルと比較して、動的モデルのアンサンブルを用いることで、モデルバイアスの低減と方策一般化の向上にどの程度寄与するか?
  • RQ3短いロールアウトとランダムな初期状態は、モデルベースのロールアウトにおける合成経験の質をどの程度向上させ、誤差の累積をどの程度軽減できるか?
  • RQ4メタ強化学習による初期化は、標準的な強化学習ベースラインと比較して、少ない訓練ラウンドで収束を早め、より優れた性能を達成できるか?
  • RQ5ModelLightは、限られた実環境相互作用で、多様な交差点タイプと実世界の交通シナリオにおいてどの程度の性能を示すか?

主な発見

  • ModelLightはわずか10ラウンドの実環境相互作用での訓練で、100ラウンド訓練されたMetaLightと同等またはそれ以上の性能を達成し、必要な実環境相互作用を90%削減した。
  • タスク1では、MetaLight-100rと比較して平均移動時間を3.95%~5.22%短縮した。タスク2では最大15.54%の改善が見られた。
  • アンサンブルモデルを用いることで、タスク全体で平均14.54%の性能向上が達成され、モデルバイアス低減の有効性が裏付けられた。
  • LSTMベースの動的モデルは、ガウス過程および全結合ネットワークと比較して、性能とパrameter効率の両面で優れており、最良の移動時間結果を達成した。
  • L=36(デフォルト)とL=120の短いロールアウトは類似した性能を示したが、L=360(短いロールアウトなし)は最も悪かった。これは、短いロールアウトが誤差低減に寄与することを確認した。
  • アブレーションスタディにより、ランダムな初期状態と短いロールアウトが、合成経験生成における一般化性能の向上と誤差の累積低減に顕著に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。