Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Mixed Autonomy Traffic Flow With Decentralized Autonomous Vehicles and Multi-Agent RL

Eugene Vinitsky, Nathan Lichtlé|arXiv (Cornell University)|Oct 30, 2020
Traffic control and management参考文献 24被引用数 9
ひとこと要約

本論文は、サンフランシスコ・オークランド・ベイ・ブリッジのような二段階のボトルネックにおける交通のスループットを最適化するため、自律走行車両(AV)向けに分散型のマルチエージェント強化学習(MARL)フレームワークを提案する。中央集権的な調整を一切用いず、ローカルなセンシングのみに依存するが、40%のAV浸透率において最大33%のスループット向上を達成しており、手動でチューニングされたフィードバック制御器でさえも上回り、固定式の信号機と同等の性能を達成している。一方で、高浸透率では学習の不安定性が生じる。

ABSTRACT

We study the ability of autonomous vehicles to improve the throughput of a bottleneck using a fully decentralized control scheme in a mixed autonomy setting. We consider the problem of improving the throughput of a scaled model of the San Francisco-Oakland Bay Bridge: a two-stage bottleneck where four lanes reduce to two and then reduce to one. Although there is extensive work examining variants of bottleneck control in a centralized setting, there is less study of the challenging multi-agent setting where the large number of interacting AVs leads to significant optimization difficulties for reinforcement learning methods. We apply multi-agent reinforcement algorithms to this problem and demonstrate that significant improvements in bottleneck throughput, from 20\% at a 5\% penetration rate to 33\% at a 40\% penetration rate, can be achieved. We compare our results to a hand-designed feedback controller and demonstrate that our results sharply outperform the feedback controller despite extensive tuning. Additionally, we demonstrate that the RL-based controllers adopt a robust strategy that works across penetration rates whereas the feedback controllers degrade immediately upon penetration rate variation. We investigate the feasibility of both action and observation decentralization and demonstrate that effective strategies are possible using purely local sensing. Finally, we open-source our code at https://github.com/eugenevinitsky/decentralized_bottlenecks.

研究の動機と目的

  • 最小限のインfrastrucureを前提として、混合自律走行環境における交通スループットの向上を目的とした分散型制御方策の設計。
  • 遅延報酬と困難な責任割り当てを伴う大規模かつマルチエージェント環境におけるMARLの有効性の評価。
  • 大規模な交通状態情報にアクセスできない状況でも、ローカルなセンシングのみで効果的な制御が可能かどうかの検証。
  • 学習されたMARL方策と手動で設計されたフィードバック制御器の比較を行い、さまざまなAV浸透率におけるロバストネスの評価。
  • オープンな交通ネットワークにおけるナッシュ均衡と社会的最適解の整合性を調査し、それらを統合する手法の提案。

提案手法

  • サンフランシスコ・オークランド・ベイ・ブリッジのボトルネックを簡略化したシミュレーションを用いる。4車線が2車線に、さらに1車線に減少する構造である。
  • 各AVが独立して動作するマルチエージェント強化学習の設定を採用。各エージェントはローカルな観測と行動に基づき、独立したQ学習を実行する。
  • 環境は、時間経過に伴う集計出力に基づくスパarsな遅延報酬を持つマークフ・意思決定過程としてモデル化される。
  • 累積スループットの最大化を目的として、経験再生とターゲットネットワークを用いた独立型ディープQネットワーク(DQN)を用いて方策を学習する。
  • 行動と観測の両方の分散化を評価し、完全にローカルなセンシング条件での性能をテストする。
  • ナッシュ均衡と社会的福祉を一致させるために、報酬構造を変更する新規なテクニックを導入。この変更により、集団のスループット最大化を促進するインcentiveが与えられる。

実験結果

リサーチクエスチョン

  • RQ1分散型マルチエージェント強化学習は、混合自律走行環境下のボトルネックにおけるスループット最適化を効果的に行えるか?
  • RQ2さまざまなAV浸透率において、MARLベースの制御器と手動で設計されたフィードバック制御器の性能はどのように比較されるか?
  • RQ3グローバルな交通状態情報にアクセスできない状況でも、ローカルなセンシングのみでどの程度効果的な制御が達成可能か?
  • RQ4MARL方策は、従来のフィードバック制御器とは異なり、AV浸透率の変化に対してロバストであるか?
  • RQ5報酬設計により、システムのナッシュ均衡を社会的最適解に一致させることは可能か?

主な発見

  • 5%のAV浸透率では、ベースラインの人間運転車両の流れに比べ、MARL制御器がボトルネックスループットを20%向上させる。
  • 40%の浸透率では、スループット向上が33%に達し、固定式信号機の性能と同等になる。
  • 広範なチューニングを行っても、浸透率の変化に伴い手動で設計されたフィードバック制御器は著しく劣化するが、MARL方策は浸透率の変化に関わらずロバストである。
  • MARL方策はローカルなセンシングのみで効果的な協調制御を実現しており、グローバルな情報が高性能を達成するために必須ではないことを示している。
  • 高浸透率ではマルチエージェントQ学習における非定常性が原因で学習の不安定性が増加するため、MADDPG や QMIX のような集中型の評価者(critic)の導入が求められる。
  • 予備的な結果から、人間ドライバーによるレーン変更が制御器の性能を損なう要因となることが示唆され、AV間の協調制御がその防止に不可欠であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。