Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Agent Constrained Policy Optimisation

Shangding Gu, Jakub Grudzien Kuba|arXiv (Cornell University)|Oct 6, 2021
Reinforcement Learning in Robotics参考文献 41被引用数 16
ひとこと要約

本稿では、制約付き方策最適化を用いて安全制約を強制する、2つの新しいモデルフリー多エージェント強化学習アルゴリズム、MACPO および MAPPO-Lagrangian を提案する。信頼領域手法とラグランジュ緩和を統合することで、両アルゴリズムは訓練の各ステップで報酬の単調な向上と厳密な制約満足を保証し、連続制御ベンチマークにおいても安全性を高めつつ優れた性能を発揮する。

ABSTRACT

Developing reinforcement learning algorithms that satisfy safety constraints is becoming increasingly important in real-world applications. In multi-agent reinforcement learning (MARL) settings, policy optimisation with safety awareness is particularly challenging because each individual agent has to not only meet its own safety constraints, but also consider those of others so that their joint behaviour can be guaranteed safe. Despite its importance, the problem of safe multi-agent learning has not been rigorously studied; very few solutions have been proposed, nor a sharable testing environment or benchmarks. To fill these gaps, in this work, we formulate the safe MARL problem as a constrained Markov game and solve it with policy optimisation methods. Our solutions -- Multi-Agent Constrained Policy Optimisation (MACPO) and MAPPO-Lagrangian -- leverage the theories from both constrained policy optimisation and multi-agent trust region learning. Crucially, our methods enjoy theoretical guarantees of both monotonic improvement in reward and satisfaction of safety constraints at every iteration. To examine the effectiveness of our methods, we develop the benchmark suite of Safe Multi-Agent MuJoCo that involves a variety of MARL baselines. Experimental results justify that MACPO/MAPPO-Lagrangian can consistently satisfy safety constraints, meanwhile achieving comparable performance to strong baselines.

研究の動機と目的

  • マルチエージェント強化学習(MARL)における安全性を保証するという重要な課題に取り組むこと。ここでの目的は、エージェントが個別および共同の安全制約を満たすようにすることである。
  • 安全な MARL を制約付きマルコフゲームとして形式化する一般的なフレームワークを構築し、体系的な研究とベンチマーク評価を可能にすること。
  • 報酬最大化と制約満足の両方を、各訓練イテレーションで保証するアルゴリズムを設計し、安全な探索を実現すること。
  • 連続制御環境における安全な MARL の評価を目的とした、最初のベンチマークスイートである「Safe Multi-Agent MuJoCo」と「Safe Multi-Agent Robosuite」を構築すること。
  • 提案手法が、最先端の MARL ベンチマークと比較して、安全制約を一貫して満たしつつ、競争力あるまたは優れた性能を達成することを実証的に検証すること。

提案手法

  • 安全な MARL を制約付きマルコフゲームとして定式化し、共同安全制約を含むマルコフ決定過程(CMDP)フレームワークを多エージェント設定に拡張する。
  • MACPO を提案する。バックトラッキングラインサーチを用いた信頼領域アプローチにより、方策更新における硬い制約を強制する。
  • MAPPO-Lagrangian を導入する。ラグランジュ目的関数に対する勾配上昇を用いるソフト制約手法であり、安全性への意識を維持する。
  • 共同クライアントと集中学習・分散実行(CTDE)を採用することで、協調学習を可能にしつつ、推論時の分散性を保つ。
  • 報酬勾配法を用い、期待報酬の単調な向上と各更新ステップでの制約満足の理論的保証を達成する。
  • 方策とラグランジュ乗数の更新を交互に実行する二重最適化スキームを実装し、報酬と安全性の目的をバランスさせる。

実験結果

リサーチクエスチョン

  • RQ1多エージェント方策最適化を、探索中でさえも各訓練イテレーションで安全制約が満たされるように拡張できるか?
  • RQ2硬い制約(MACPO)とソフト制約(MAPPO-Lagrangian)は、制約満足の安定性と最終的性能においてどのように比較されるか?
  • RQ3安全な MARL アルゴリズムは、制約なしの MARL ベンチマークと同等またはそれ以上の累積報酬を達成しつつ、安全な方策領域に留まることができるか?
  • RQ4MAPPO、IPPO、HAPPO などの既存の MARL アルゴリズムは、連続制御環境においてどの程度安全制約を満たさないか?
  • RQ5多様なタスクにわたって安全意識を持つアルゴリズムを公平に評価・比較できる、統一された安全な MARL ベンチマークスイートを設計できるか?

主な発見

  • MACPO および MAPPO-Lagrangian は、すべてのタスクでほぼゼロのコスト値を達成しており、訓練全体を通して安全制約が一貫して厳密に満たされていることが示された。
  • 両アルゴリズムは、初期方策が不安全であっても、初期段階から安全な探索を維持できる。これに対して、IPPO や MAPPO、HAPPO は頻繁に制約を違反する。
  • MAPPO-Lagrangian は、Ant を用いた困難なタスクにおいて、MACPO よりも高い平均累積報酬を達成しており、より優れたサンプル効率性または最適化安定性を示している。
  • MAPPO-Lagrangian の性能は、制約なしの MAPPO よりも困難な Ant タスクで優れている。これは、安全制約が性能を必ずしも低下させないことを示している。
  • HAPPO はすべての手法の中で最高の報酬を得たが、安全制約を満たさなかった。これは、既存のアプローチにおいて性能と安全性のトレードオフが顕著であることを示している。
  • 提案されたベンチマークスイートである SMAMuJoCo および SMARobosuite は、障害物回避を伴う Peg-in-Hole などの現実的な安全制約付きマルチエージェント操作タスクを的確に捉えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。