Skip to main content
QUICK REVIEW

[論文レビュー] Parameter Sharing Reinforcement Learning Architecture for Multi Agent Driving Behaviors

Meha Kaushik, S Phaniteja|arXiv (Cornell University)|Nov 17, 2018
Traffic control and management参考文献 21被引用数 10
ひとこと要約

本稿では、複数のドライビング行動の学習を可能にするパラメータ共有型ディープ決定的ポリシー勾配(PS-DDPG)アーキテクチャを提案する。この手法により、共有されたエージェント・クリティックネットワークを用いて、並列かつスケーラブルに走行線維持と追い越し行動の両方を学習できる。明示的な通信を伴わないにもかかわらず、収束が速く、協調的行動が安定して得られ、サンプル効率およびスケーラビリティにおいて独立したDDPG学習を上回る性能を発揮する。

ABSTRACT

Multi-agent learning provides a potential framework for learning and simulating traffic behaviors. This paper proposes a novel architecture to learn multiple driving behaviors in a traffic scenario. The proposed architecture can learn multiple behaviors independently as well as simultaneously. We take advantage of the homogeneity of agents and learn in a parameter sharing paradigm. To further speed up the training process asynchronous updates are employed into the architecture. While learning different behaviors simultaneously, the given framework was also able to learn cooperation between the agents, without any explicit communication. We applied this framework to learn two important behaviors in driving: 1) Lane-Keeping and 2) Over-Taking. Results indicate faster convergence and learning of a more generic behavior, that is scalable to any number of agents. When compared the results with existing approaches, our results indicate equal and even better performance in some cases.

研究の動機と目的

  • 現実的でスケーラブルなマルチエージェント交通行動をシミュレートするための、パラメータ共有型強化学習フレームワークの開発。
  • 1つの共有ポリシー・ネットワークを用いて、走行線維持と追い越しという複数のドライビング行動を同時に学習可能にする。
  • エージェントの同質性と非同期更新を活用することで、学習効率と収束速度を向上させる。
  • 共有学習フレームワークにおいて、明示的な通信なしに協調行動が自然に出現することを示す。
  • 自律走行シミュレータにおける行動ベース交通の生成のためのスケーラブルなソリューションを提供する。

提案手法

  • すべての同質的エージェントに共通のアクター・クリティックネットワークを採用することで、パrameter数を削減し、経験の共有を可能にする。
  • 各エージェントがリプレイバッファに寄与し、1タイムステップあたりNステップ更新を用いて共有ネットワークを非同期に更新する。
  • 状態空間には相対的位置、速度、レーン情報が含まれる。行動は連続的制御入力(ステアリングとアクセル)である。
  • 進行度、安全性、および行動固有の要素を組み合わせた複合報酬関数を用い、走行線維持と追い越しの両方を促進する。
  • 非定常なマルチエージェント環境における学習安定化のため、カリキュラム学習と非同期学習を採用する。
  • 再トレーニングなしに動的エージェント追加が可能であり、任意のエージェント数へのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ11つの共有アクター・クリティックネットワークが、走行線維持と追い越しという2つの明確に異なるドライビング行動を同時に学習可能か?
  • RQ2同質的エージェント間でのパラメータ共有は、独立したDDPG学習と比較して、学習速度と収束性を向上させるか?
  • RQ3共有ポリシー枠組みにおいて、明示的な通信なしにエージェント間の協調行動が出現するか?
  • RQ4環境内でのエージェント数の増加に伴い、このフレームワークはどのようにスケーリングするか?
  • RQ5共有経験リプレイと非同期更新は、学習の安定性とパフォーマンスにどのような影響を与えるか?

主な発見

  • PS-DDPGは、追い越しと走行線維持の両方で600エピソードで収束したのに対し、独立したDDPG学習では2,000エピソード以上を要した。
  • 共有ネットワークは、さまざまなエージェント設定(ケースA、B、C)において、安定したパフォーマンスで両方の行動を同時に学習し、シナリオレイアウトに対して頑健であることが示された。
  • 同時学習において、平均進行度はケースAで59.36、ケースBで82.18、ケースCで60.17に達し、シナリオ全体にわたる一貫性ある行動学習が確認された。
  • シーンの複雑さのため、衝突率は単一行動学習より高かったが、20エピソードにわたり安定しており、それぞれケースAで79.33、ケースBで142、ケースCで111を記録した。
  • フレームワークにより、エージェント同士が自然に協調した:走行線維持エージェントは追い越しを許可するため一時的に減速し、その後進行度を最大化するために再加速した。
  • 本手法はスケーラビリティを示しており、新たなエージェントの追加に再トレーニングやリソースの大幅増加を要せず、大規模交通シミュレータへの展開が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。