Skip to main content
QUICK REVIEW

[論文レビュー] Multi-agent navigation based on deep reinforcement learning and traditional pathfinding algorithm

Hongda Qiu|arXiv (Cornell University)|Dec 5, 2020
Robotic Path Planning Algorithms参考文献 23被引用数 5
ひとこと要約

本稿では、複雑で動的な環境におけるマルチエージェントナビゲーションと衝突回避を解決するため、深層強化学習(DRL)と従来のパスファインディングアルゴリズムを組み合わせたハイブリッドフレームワークを提案する。DRLを用いてリアルタイムの意思決定を学習すると同時に、A*を用いてグローバルパスプランニングを実施することで、再訓練を必要とせず、さまざまなシナリオにおいて高い成功確率、低いパスコスト(EDP)、および高い一般化性能を達成した。特にスケーリングの面で優れた性能を示した。

ABSTRACT

We develop a new framework for multi-agent collision avoidance problem. The framework combined traditional pathfinding algorithm and reinforcement learning. In our approach, the agents learn whether to be navigated or to take simple actions to avoid their partners via a deep neural network trained by reinforcement learning at each time step. This framework makes it possible for agents to arrive terminal points in abstract new scenarios. In our experiments, we use Unity3D and Tensorflow to build the model and environment for our scenarios. We analyze the results and modify the parameters to approach a well-behaved strategy for our agents. Our strategy could be attached in different environments under different cases, especially when the scale is large.

研究の動機と目的

  • 高密度のエージェントが存在する動的な環境において、スケーラブルで衝突のないマルチエージェントナビゲーションを実現すること。
  • 純粋な強化学習では、未確認のシナリオにおけるサンプル効率と一般化性能に課題があるため、その限界を克服すること。
  • 従来のパスファインディング(A*)と深層強化学習を統合することで、マルチエージェントシステムにおける信頼性と効率を向上させること。
  • 再訓練を必要とせず、異なる環境やエージェント数に一般化可能な戦略を開発すること。

提案手法

  • フレームワークは、強化学習を通じてナビゲーションポリシーを学習するためのディープQネットワーク(DQN)を用いる。エージェントは、事前に計算されたA*パスに従うか、回避行動を取るかを決定する。
  • 各タイムステップで、DRLエージェントは自身の状態を評価し、学習済みポリシーに基づいて行動(例:移動、回避)を実行する。観測は8次元の距離センサーから得られる。
  • A*アルゴリズムは事前にオフラインで衝突のないグローバルパスを生成し、DRLエージェントが局所的意思決定を最適化するための基準として用いる。
  • 4層または8層の全結合層を備えたマルチレイヤーパーセプトロン(MLP)が、状態入力を処理し、DRLポリシーの行動確率を出力する。
  • 報酬関数は、ゴールに素早く到達することを奨励すると同時に、衝突やパスの著しい逸脱に対してペナルティを課す。
  • システムはUnity3Dで訓練され、TensorFlowを用いて、四面壁、ランダム障害物、サークルトランスポート設定を含むさまざまなシナリオをシミュレートしている。

実験結果

リサーチクエスチョン

  • RQ1エージェント密度や環境が変化する状況下で、純粋な強化学習に比べ、ハイブリッドDRLとパスファインディング手法がマルチエージェントナビゲーションにおいて優れた性能を示すか?
  • RQ2訓練済みポリシーは再訓練なしに未確認のシナリオにどれほど一般化できるか?
  • RQ3A*パスファインディングとDRLを組み合わせることで、エンドツーエンドRLに比べてサンプル効率と収束速度が向上するか?
  • RQ4ニューラルネットワークの深さ(4層対8層の全結合層)がポリシーの性能と頑健性に与える影響は何か?
  • RQ5複雑で混雑した環境において、エージェント数の増加に伴い、この手法はどのようにスケーリングするか?

主な発見

  • 基本シナリオでは、提案手法はN=40で98.4%の成功確率(EDP 0.516 ± 0.218)を達成し、純粋なRL手法(98.3%成功、EDP 0.573 ± 0.236)を上回った。
  • N=200では、8層の手法が96.1%の成功確率(EDP 0.866 ± 0.425)を維持したが、純粋なRLは53.2%まで低下した。
  • クロスロードシナリオでは、N=40で99.9%の成功確率、N=160で92.3%の成功確率を達成し、衝突率はほぼゼロだった。
  • 四面壁シナリオでは、N=30で96.9%の成功確率(衝突率3%)を達成したが、純粋なRLは36%の衝突率を示した。
  • 基本シナリオで訓練されたポリシーは、新しいシナリオ(例:サークルトランスポート、ランダム障害物)にも良好に一般化され、クロスロードシナリオで99.9%、RO-N=120シナリオで96.0%の成功確率を達成した。
  • 本手法は、さまざまなマップタイプとエージェント数において強く頑健であり、純粋なRLに比べて一貫して低いEDPと衝突率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。