Skip to main content
QUICK REVIEW

[論文レビュー] SCRIMP: Scalable Communication for Reinforcement- and Imitation-Learning-Based Multi-Agent Pathfinding

Yutong Wang, Bairan Xiang|arXiv (Cornell University)|Mar 1, 2023
Robotic Path Planning Algorithms被引用数 4
ひとこと要約

SCRIMPは、3×3の視野のみを用いて衝突のない経路を学習できるスケーラブルで通信を強化した強化学習および模倣学習フレームワークを提案する。変更を加えたTransformerベースのグローバル通信メカニズム、確率的確率的決定法、および内発的報酬を活用することで、SCRIMPは中央集権的プランナと同等の性能を達成しながら、大規模なチームにおいても高いスケーラビリティを維持する。

ABSTRACT

Trading off performance guarantees in favor of scalability, the Multi-Agent Path Finding (MAPF) community has recently started to embrace Multi-Agent Reinforcement Learning (MARL), where agents learn to collaboratively generate individual, collision-free (but often suboptimal) paths. Scalability is usually achieved by assuming a local field of view (FOV) around the agents, helping scale to arbitrary world sizes. However, this assumption significantly limits the amount of information available to the agents, making it difficult for them to enact the type of joint maneuvers needed in denser MAPF tasks. In this paper, we propose SCRIMP, where agents learn individual policies from even very small (down to 3x3) FOVs, by relying on a highly-scalable global/local communication mechanism based on a modified transformer. We further equip agents with a state-value-based tie-breaking strategy to further improve performance in symmetric situations, and introduce intrinsic rewards to encourage exploration while mitigating the long-term credit assignment problem. Empirical evaluations on a set of experiments indicate that SCRIMP can achieve higher performance with improved scalability compared to other state-of-the-art learning-based MAPF planners with larger FOVs, and even yields similar performance as a classical centralized planner in many cases. Ablation studies further validate the effectiveness of our proposed techniques. Finally, we show that our trained model can be directly implemented on real robots for online MAPF through high-fidelity simulations in gazebo.

研究の動機と目的

  • 複雑な共同行動を要する状況で困難をきたす、部分観測に基づく分散型MAPFプランナのスケーラビリティおよびパフォーマンスの制限を解消すること。
  • 最小限の局所的観測(3×3 FOV)を持つエージェントが、スケーラブルで動的通信を用いて高い成功確率を達成できるようにすること。
  • 長期間にわたる報酬割り当て問題を軽減し、報酬が疎である環境での探索を改善すること。
  • 「騒音問題(chatter problem)」を回避しつつ、効果的なチーム協調を可能にする通信メカニズムを設計すること。
  • 高精細なロボットシミュレーションを用いて、学習済みポリシーの実世界への展開可能性を検証すること。

提案手法

  • エージェント間のメッセージを動的に統合できるように変更を加えたTransformerエンコーダを導入し、チーム全体にわたるスケーラブルで選択的な情報共有を可能にする。
  • 状態価値に基づく確率的決定法を採用し、学習された長期的チーム価値に基づいてエージェントの優先順位を決定することで、頂点衝突およびスワップ衝突を解消する。
  • エピソードバッファを用いた内発的報酬メカニズムを組み込み、探索を促進し、ゴール到達確率を向上させる。
  • 深層強化学習と模倣学習をハイブリッドで用いることで、学習の安定化とサンプル効率の向上を図る。
  • 局所的観測とグローバル通信のみを用いた完全分散型推論設定を採用し、リアルタイムでのオンライン計画を可能にする。
  • エージェント間通信が存在しない状況では自己メッセージ機構を用いることで、通信モジュールの貢献を明確に分離する。

実験結果

リサーチクエスチョン

  • RQ1変更を加えたTransformerに基づく、高スケーラビリティで微分可能な通信メカニズムは、最小限の局所的観測を持つ分散型MAPFでパフォーマンスを向上させることができるか?
  • RQ2学習された状態価値に基づく確率的決定法は、対称的なMAPFシナリオにおいて、ランダムまたは固定優先順位の衝突解決法を上回るか?
  • RQ3エピソード的探索に基づく内発的報酬は、報酬が疎なMAPF環境において、学習効率および成功確率をどの程度向上させるか?
  • RQ4SCRIMPのパフォーマンスは、さまざまなチームサイズやタスクの複雑さにおいて、最先端の学習ベースおよび古典的中央集権的プランナと比較してどの程度優れているか?
  • RQ5ランダムで構造のない環境で学習したポリシーは、再訓練なしに構造的で高精細なシミュレーション環境における実際のロボットに直接展開可能か?

主な発見

  • SCRIMPは、共同行動を要する複雑なシナリオを含め、ほとんどのタスクで古典的中央集権プランナであるODataM*と同等の成功確率を達成する。
  • エージェント密度が高く、レイアウトが複雑な挑戦的なタスクにおいても、SCRIMPは、より広い視野を持つ最新の学習ベースプランナですら上回る。
  • アブレーションスタディにより、通信モジュールを削除した場合(SCRIMP-without-com)に成功確率が最低になることが確認され、通信モジュールが複雑なタスクにおいて極めて重要な役割を果たしていることが裏付けられた。
  • 確率的決定法は、対称的衝突シナリオにおいて、ランダムまたは固定優先順位戦略よりも顕著にパフォーマンスを向上させる。
  • 内発的報酬メカニズムにより探索が促進され、長期的報酬割り当て問題が軽減され、外発的報酬のみを用いたベースラインと比較して、複雑なタスクにおける成功確率が向上した。
  • 学習済みのSCRIMPポリシーは、再訓練なしにGazebo上での16台の実際のロボットに正常に展開され、高精細シミュレーション環境でリアルタイムかつ衝突のない経路計画が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。