Skip to main content
QUICK REVIEW

[論文レビュー] Distributed traffic light control at uncoupled intersections with real-world topology by deep reinforcement learning

Mark Schutera, Niklas Goby|arXiv (Cornell University)|Nov 27, 2018
Traffic control and management参考文献 17被引用数 7
ひとこと要約

本稿では、現実の都市部の交差点構造を想定した、非結合型交差点における深層強化学習(DRL)に基づく分散型信号制御(TLC)手法を提案する。行動空間に段階選択と遷移タイミングの両方を組み込むことで、現実の道路網構造を考慮した制御を実現している。SUMOを用いてフリードリヒスハーフェンの実際の道路網で評価した結果、時間損失が著しく低減され、固定周期、ギャップベース、時間ベースのベースライン手法と比較して、多様な交差点形状において平均で少なくとも5秒以上改善し、不規則な構造に対しても頑健であることが示された。

ABSTRACT

This work examines the implications of uncoupled intersections with local real-world topology and sensor setup on traffic light control approaches. Control approaches are evaluated with respect to: Traffic flow, fuel consumption and noise emission at intersections. The real-world road network of Friedrichshafen is depicted, preprocessed and the present traffic light controlled intersections are modeled with respect to state space and action space. Different strategies, containing fixed-time, gap-based and time-based control approaches as well as our deep reinforcement learning based control approach, are implemented and assessed. Our novel DRL approach allows for modeling the TLC action space, with respect to phase selection as well as selection of transition timings. It was found that real-world topologies, and thus irregularly arranged intersections have an influence on the performance of traffic light control approaches. This is even to be observed within the same intersection types (n-arm, m-phases). Moreover we could show, that these influences can be efficiently dealt with by our deep reinforcement learning based control approach.

研究の動機と目的

  • 現実の交差点構造、特に不規則で非対称的なレイアウトが分散型信号制御(TLC)性能に与える影響を調査すること。
  • 限られたセンサデータを前提とした状況下でも、複雑な現実の交差構造を扱える深層強化学習(DRL)の有効性を評価すること。
  • 現実の交通状況下で、固定周期、ギャップベース、時間ベースの制御戦略と比較して、DRLに基づくTLCの有効性を検証すること。
  • DRLが段階選択と遷移タイミングの両方をモデル化できることを示し、非理想かつ現実的な環境でも適応的最適化を可能にすること。

提案手法

  • フリードリヒスハーフェンの現実の道路網を、双方向グラフとしてSUMOにモデル化し、交差点をノード、道路区間をエッジとして表現した。
  • 信号制御は、段階選択と遷移タイミングの両方を学習で選択するDRLエージェントを用いて実装した。これは、従来のタイミングのみの行動空間を拡張したものである。
  • 状態空間は、主に誘導ループ検出器(ILD)からの実際のセンサデータに制限され、過剰に楽観的な状態表現を避けることを目的としていた。
  • 時間損失を最小化するためのカスタム報酬関数を定義した。時間損失とは、交差点での停止に起因して、車両が最大速度未満で走行する累積時間として定義された。
  • 3600ステップのテストシーケンスを用いて、マイクロスケール交通シミュレーション環境でDRLエージェントを訓練および評価した。
  • ベースライン手法には、固定周期、ギャップベース、時間ベースの制御戦略が含まれ、すべて同じシミュレーション条件下で評価された。

実験結果

リサーチクエスチョン

  • RQ1現実の交差点構造、特に不規則で非対称的なレイアウトが、分散型信号制御システムの性能にどのように影響を与えるか。
  • RQ2DRLベースのTLCアプローチは、実際のセンサ制限のもとで、多様な交差構造(例:三途交差 vs. 四途交差、段階数の違い)を効果的に処理できるか。
  • RQ3DRLの行動空間に段階選択と遷移タイミングの両方を組み込むことで、タイミングのみのアプローチに比べて性能が向上するか。
  • RQ4DRLアプローチは、固定周期、ギャップベース、時間ベースの従来の制御戦略と比較して、時間損失、燃料消費、騒音排出量の観点でどのように差をつけるか。
  • RQ5DRLモデルは、異なる交差点タイプ間で時間損失のばらつきをどの程度低減するか。また、外れ値に対してもどのように対処するか。

主な発見

  • DRLベースの手法は、ほぼすべての評価対象交差点で、ベースライン手法と比較して平均時間損失を少なくとも5秒以上低減した。これは、同じ本数の腕と段階数を持つ交差点に対しても同様に成立した。
  • 現実の構造がTLC性能に顕著な影響を与えることが判明した。例えば、四段階三腕交差点においても、幾何的不規則性のため、時間損失は4〜11秒の差異を示した。
  • DRL手法の時間損失の四分位範囲は6秒未満であり、大多数の車両に対して安定した流れのなだらかさを実現していることが示された。
  • J1、J2、J3、J4の交差点において、DRLモデルはすべてのベースラインを上回ったが、J4では最良のベースラインと同等の性能を示した。
  • ウェルチの二標本t検定により、DRL手法とベースライン手法との間で、ほぼすべての交差点で平均時間損失に統計的に有意な差があることが確認された。
  • 一部の外れ値が存在しても、DRLモデルの性能はベースラインの範囲内に収まっており、頑健性と実用的妥当性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。