Skip to main content
QUICK REVIEW

[論文レビュー] Heterogeneous Multi-Agent Reinforcement Learning for Unknown Environment Mapping

Ceyer Wakilpoor, Patrick Martin|arXiv (Cornell University)|Oct 6, 2020
Reinforcement Learning in Robotics参考文献 13被引用数 14
ひとこと要約

本稿では、固定長の観測符号化と三重学習損失を備えた新規のアクター・クリティックフレームワークを用いて、未知の環境における分散型で協調的なカバレッジを実現する異種マルチエージェント強化学習アルゴリズムであるEMACを提案する。EMACは、従来の経路計画法および独立型強化学習ベースラインを上回り、乱流、通信遅延、エージェントの故障、およびより大きな環境や多様なチーム編成へのスケーラビリティに対しても頑健であることを示している。

ABSTRACT

Reinforcement learning in heterogeneous multi-agent scenarios is important for real-world applications but presents challenges beyond those seen in homogeneous settings and simple benchmarks. In this work, we present an actor-critic algorithm that allows a team of heterogeneous agents to learn decentralized control policies for covering an unknown environment. This task is of interest to national security and emergency response organizations that would like to enhance situational awareness in hazardous areas by deploying teams of unmanned aerial vehicles. To solve this multi-agent coverage path planning problem in unknown environments, we augment a multi-agent actor-critic architecture with a new state encoding structure and triplet learning loss to support heterogeneous agent learning. We developed a simulation environment that includes real-world environmental factors such as turbulence, delayed communication, and agent loss, to train teams of agents as well as probe their robustness and flexibility to such disturbances.

研究の動機と目的

  • 動的で危険な状況下における未知環境カバレッジのための分散型マルチエージェント強化学習手法の開発。
  • 異なるセンサー搭載量を持つ異種エージェントを協調的カバレッジタスクに適用する課題への対処。
  • 通信遅延、風の乱流、エージェントの故障などの実世界の環境的擾乱に対する頑健性の向上。
  • 環境サイズやチーム編成の増加に伴うマルチエージェント方策のスケーラビリティの向上。
  • 新規のピクセルベースの状態表現と固定長埋め込みアーキテクチャを用いて、重複を最小限に抑えた効率的で協調的なカバレッジの実現。

提案手法

  • EMACは、可変長のエージェント観測を固定長の埋め込みに変換する共有エンコーダーネットワークを備えたマルチエージェントアクター・クリティックフレームワークを採用する。
  • 埋め込み空間に三重学習損失が適用され、同一のグローバル状態の同時視点を引き寄せ、時間的に近いが機能的に異なる視点を排斥する。
  • 近距離と遠距離の視覚的観測を組み合わせた状態表現により、座標ベースの手法を上回る環境認識能力が向上する。
  • エージェント間でのパラメータ共有をサポートすることで、異なるセンサー能力を持つエージェントでも効率的な学習が可能になる。
  • 風の乱流、通信遅延、エージェント喪失などの実世界の擾乱を導入したカスタムシミュレーション環境を用いて、頑健性を評価する。
  • エージェントが部分的に観測可能な動的環境で経験を積みながら、エンドツーエンドで深層強化学習を用いて学習する。

実験結果

リサーチクエスチョン

  • RQ1異種エージェントを用いた未知環境カバレッジのための分散型マルチエージェント強化学習アプローチは、効果的に分散型方策を学習できるか?
  • RQ2提案された固定長観測符号化と三重損失は、異種マルチエージェント環境における学習をどのように改善するか?
  • RQ3EMACアルゴリズムは、通信遅延や風の乱流などの実世界の環境擾乱に対してどの程度頑健か?
  • RQ4EMACは、環境サイズやチームサイズの増加に伴ってどのようにスケーリングするか?
  • RQ5特にセンサー範囲の異質さを含むチーム編成は、カバレッジ性能にどのように影響を与えるか?

主な発見

  • EMACは、未知環境カバレッジタスクにおいて、従来のマルチビークル経路計画法および独立型DRLベースラインを上回った。
  • 40%の風乱流下では、EMACはグリッドをカバーするのに28.19ステップを要し、ベースラインの15.91ステップから77.2%の増加を示した。
  • 2体のエージェントが故障した状況では、完了時間が41.81ステップに増加し、ベースライン比で67.5%の増加を示した。
  • 32×32グリッド(16×16のトレーニンググリッドの4倍)にスケーリングした場合、完了時間は14倍に増加し、235.74ステップに達した。
  • 大規模エージェント(9×9 FoV)の割合を増やすことで、平均カバレッジ時間は3体の小型エージェントの32.72ステップから、3体の大規模エージェントの22.79ステップに短縮された。
  • 同種および異種のチーム編成の両方で、アルゴリズムは滑らかに性能を発揮し、中間的な編成では一貫した改善が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。