Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Multiagent Driving Policies For Reducing Traffic Congestion

Jiaxun Cui, William Macke|arXiv (Cornell University)|Feb 26, 2021
Traffic control and management参考文献 24被引用数 9
ひとこと要約

本稿は、大規模でオープンな道路網における交通渋滞を軽減するために、流出量(outflow)を交通効率の頑健な指標として用いることで、スケーラブルで分散型のマルチエージェント強化学習フレームワークを提案する。このフレームワークは、モジュラーな転移学習アプローチを導入し、学習時間を80%短縮する。また、通信インfraストラクチャを必要とせず、完全に分散型の方策を採用した初めての実装であり、人間運転の交通状況を上回ることを実証した。

ABSTRACT

Traffic congestion is a major challenge in modern urban settings. The industry-wide development of autonomous and automated vehicles (AVs) motivates the question of how can AVs contribute to congestion reduction. Past research has shown that in small scale mixed traffic scenarios with both AVs and human-driven vehicles, a small fraction of AVs executing a controlled multiagent driving policy can mitigate congestion. In this paper, we scale up existing approaches and develop new multiagent driving policies for AVs in scenarios with greater complexity. We start by showing that a congestion metric used by past research is manipulable in open road network scenarios where vehicles dynamically join and leave the road. We then propose using a different metric that is robust to manipulation and reflects open network traffic efficiency. Next, we propose a modular transfer reinforcement learning approach, and use it to scale up a multiagent driving policy to outperform human-like traffic and existing approaches in a simulated realistic scenario, which is an order of magnitude larger than past scenarios (hundreds instead of tens of vehicles). Additionally, our modular transfer learning approach saves up to 80% of the training time in our experiments, by focusing its data collection on key locations in the network. Finally, we show for the first time a distributed multiagent policy that improves congestion over human-driven traffic. The distributed approach is more realistic and practical, as it relies solely on existing sensing and actuation capabilities, and does not require adding new communication infrastructure.

研究の動機と目的

  • 動的かつ変化する車両の流入・流出が見られるオープンロードネットワークにおいて、平均速度といった従来の渋滞指標が操作可能であるという限界を是正する。
  • 数百台の車両が存在する大規模で現実的ないくつかのオープンネットワークにおいて、交通効率を向上させるスケーラブルなマルチエージェントドライブポリシーを構築する。
  • 中央集権的な調整や新たな通信インfraストラクチャに依存せず、ローカルなセンシングとアクチュエーションのみに依存する分散型マルチエージェント強化学習ポリシーを設計する。
  • 小規模なネットワークから大規模なネットワーク領域へのポリシー転送を可能にするモジュラーな転移学習アプローチを用いて、大規模な交通シナリオにおける学習時間と計算コストを削減する。
  • 分散型ポリシーが、通信インfraストラクチャを必要とせず、人間運転の交通状況を上回る渋滞軽減効果を示すことを実証する。

提案手法

  • 流出量(ネットワークからの車両排出レート)を、強化学習エージェントによる操作に弱い平均速度とは対照的に、頑健な代替指標として採用する。
  • 自己中心的(速度に基づく)および協調的(流出促進)な要素を組み合わせたハイブリッド報酬関数を設計し、適切なタイミングでの出庫を促すために排出ボーナスを導入する。
  • モジュラーな転移強化学習アプローチを実装:小規模なシナリオで集中型ポリシーを学習し、それを大規模で現実的なネットワーク(ミケイガン州のI-696)の主要領域(例:交差点)に転送する。
  • 窓付き推論戦略を用いて、大規模ネットワークにおけるローカルなポリシー適用を実現し、状態空間と行動空間の複雑さを低減しながらも性能を維持する。
  • カリキュラム学習と報酬形状調整を用いて安定した学習と収束を促進するため、Proximal Policy Optimization (PPO) を用いてポリシーを学習する。
  • 性能評価には流出量と平均速度を用い、人間運転のベースラインおよびエンドツーエンドから学習したポリシーとを比較する。

実験結果

リサーチクエスチョン

  • RQ1動的流入・流出が見られるオープンロードネットワークにおいて、広く用いられている平均速度指標は、交通効率を信頼できる方法で測定できるか?
  • RQ2平均速度に比べ、流出量指標はオープンネットワーク環境下で強化学習エージェントによる操作に対してより頑健か?
  • RQ3モジュラーな転移学習アプローチは、小規模ネットワークから大規模で現実的なオープンネットワークへのマルチエージェントドライブポリシーのスケーリングを、学習時間を短縮しながら効果的に実現できるか?
  • RQ4ローカルなセンシングのみに依存する完全に分散型のマルチエージェント強化学習ポリシーは、オープンネットワークにおいて人間運転の交通状況を上回る交通効率向上を達成できるか?
  • RQ5自己中心的・協調的・排出ボーナス報酬のハイブリッドな組み合わせは、従来の報酬関数と比較して、より高い流出量とより低い渋滞を実現できるか?

主な発見

  • 平均速度指標は、オープンロードネットワークにおいて操作可能である:強化学習エージェントは、車両の排出を遅らせる手法により平均速度を意図的に上昇させることができ、誤った性能評価を引き起こす。
  • 流出量指標は操作に対して頑健であり、オープンネットワークにおける真のシステムレベルの交通効率をより適切に反映するため、優れた評価指標である。
  • モジュラーな転移学習アプローチにより、大規模ネットワーク全体を新規に学習する場合と比較して、学習時間を最大80%短縮でき、人間運転の交通状況およびエンドツーエンドで学習したポリシーを上回る高い流出量を達成した。
  • 最良の性能を示した分散型ポリシーは、1時間あたり1796.76台の流出量を達成し、人間ベースライン(1770.0)を1.6%上回り、一部の設定では集中型ポリシーをも上回った。
  • 自己中心的報酬(η₁=1)、協調的報酬の重み10%(η₂=0.1)、排出ボーナス20のハイブリッド報酬関数が、最大の流出量(1796.76)を達成し、排出インcentiveの重要性を示した。
  • 分散型ポリシーは、通信インfraストラクチャを必要とせず、人間運転の交通状況に対して統計的に有意な渋滞軽減を達成した。これにより、実世界への実用的かつスケーラブルな展開が妥当であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。