Skip to main content
QUICK REVIEW

[論文レビュー] Reciprocal Collision Avoidance for General Nonlinear Agents using Reinforcement Learning

Hao Li, Bowen Weng|arXiv (Cornell University)|Oct 24, 2019
Robotic Path Planning Algorithms参考文献 19被引用数 4
ひとこと要約

本稿では、連続的アクション空間を持つ一般化された非線形エージェントを対象とした強化学習(RL)ベースの分散型衝突回避手法を提案する。RLで学習された二エージェントポリシーとORCAに基づく安全制約を組み合わせることで、衝突のない滑らかな軌道を実現する。この手法により、リアルタイム通信を必要とせず、高速かつスケーラブルなマルチエージェントナビゲーションが可能となり、非線形力学を有する複雑で動的なシナリオにおいて、従来のRL手法に比べて安全性と一般化性能が優れている。

ABSTRACT

Finding feasible and collision-free paths for multiple nonlinear agents is challenging in the decentralized scenarios due to limited available information of other agents and complex dynamics constraints. In this paper, we propose a fast multi-agent collision avoidance algorithm for general nonlinear agents with continuous action space, where each agent observes only positions and velocities of nearby agents. To reduce online computation, we first decompose the multi-agent scenario and solve a two agents collision avoidance problem using reinforcement learning (RL). When extending the trained policy to a multi-agent problem, safety is ensured by introducing the optimal reciprocal collision avoidance (ORCA) as linear constraints and the overall collision avoidance action could be found through simple convex optimization. Most existing RL-based multi-agent collision avoidance algorithms rely on the direct control of agent velocities. In sharp contrasts, our approach is applicable to general nonlinear agents. Realistic simulations based on nonlinear bicycle agent models are performed with various challenging scenarios, indicating a competitive performance of the proposed method in avoiding collisions, congestion and deadlock with smooth trajectories.

研究の動機と目的

  • 限られたエージェント間通信を想定した、一般化された非線形エージェントにおける分散型でリアルタイムの衝突回避の課題に対処すること。
  • 直接的な速度制御を仮定するが、安全保証が欠如している既存のRLベースの手法の限界を克服すること。
  • 自転車モデルなどの非線形力学を有する多数のエージェントを含む複雑なシナリオにおいて、スケーラブルで安全なナビゲーションを可能にすること。
  • 対称的または高密度な構成におけるデッドロックや混雑を回避し、全体的なシステムの安全性を確保すること。
  • サンプル効率の良いRL学習とORCA制約による凸最適化を組み合わせ、高速で信頼性の高い行動選択を実現すること。

提案手法

  • 相対的位置と相対速度のみを観測として用いて、二エージェント衝突回避タスクに深層決定的方策勾配(DDPG)エージェントを学習する。
  • マルチエージェント問題を二重の相互作用に分解し、学習済みのRLポリシーを各ペアに適用して避難行動の候補を生成する。
  • 最適相互衝突回避(ORCA)フレームワークから導出された線形速度制約を用いて安全を確保し、衝突のない運動を保証する。
  • 個々のRL行動を組み合わせつつORCA制約を尊重するように、全体のマルチエージェント行動を凸最適化問題として定式化する。
  • 推論時にシンプルで効率的な最適化ステップを用いて最終行動を計算し、オンライン計算を最小限に抑える。
  • 学習済みポリシーを、エージェント数が変動する状況、さらには最大42エージェントを含む大規模な設定にも拡張する。

実験結果

リサーチクエスチョン

  • RQ1二エージェント衝突回避のための学習済みRLポリシーは、非線形力学を有するマルチエージェントシステムに効果的に一般化可能か?
  • RQ2リアルタイム通信を必要としない分散型RLベースのマルチエージェントナビゲーションシステムにおいて、安全を体系的に保証する方法は何か?
  • RQ3RLとORCA制約を組み合わせることで、純粋なRLやORCA単体に比べて、安全性と性能がどの程度向上するか?
  • RQ4本手法は、対称的または高密度なエージェント配置におけるデッドロックや混雑を回避できるか?
  • RQ5ORCA制約の統合は、生成された軌道の滑らかさと現実性にどのような影響を与えるか?

主な発見

  • 本手法は、対称的で高リスクな構成、特に古典的なORCAデッドロックシナリオを含む最大8エージェントにおいて、衝突のない滑らかな軌道を効果的に生成した。
  • 42エージェントの円形配置では、エージェントが全員右に曲がり、原点を左から通過することで安全なナビゲーションを達成し、ORCA制約付きの行動によって衝突を回避した。
  • 共通中心の円運動を伴う20エージェントタスクでは、エージェント間の複雑な双方向的相互作用が存在しても、安全で調整の取れた軌道を生成した。
  • 24エージェントの例におけるアブレーション解析から、ORCA制約が不可欠であることが示された。制約なしではRLポリシー単体が衝突を引き起こすが、ORCAによる行動修正で是正された。
  • 凸最適化により高速な推論が実現され、複雑な非線形エージェントの力学を有する状況でもリアルタイム性能を達成した。
  • 本手法は優れた一般化性能を示し、トレーニング時に見なかった動的エージェント数や複雑なシナリオに対しても対応可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。