Skip to main content
QUICK REVIEW

[論文レビュー] Safe Multi-Agent Reinforcement Learning through Decentralized Multiple Control Barrier Functions

Zhiyuan Cai, Huanhui Cao|arXiv (Cornell University)|Mar 23, 2021
Reinforcement Learning in Robotics参考文献 24被引用数 13
ひとこと要約

本稿では、複数の制御バリア関数(CBFs)を統合することで、マルチエージェントシステムにおける衝突回避を保証する分散型安全なマルチエージェント強化学習フレームワークを提案する。MADDPGに分散型CBFsを組み合わせたMADDPG-CBFを提案し、理論的な安全保証を示し、実験でも、標準のMADDPGとは異なり、衝突のない学習と安定した高い報酬を達成していることを示している。

ABSTRACT

Multi-Agent Reinforcement Learning (MARL) algorithms show amazing performance in simulation in recent years, but placing MARL in real-world applications may suffer safety problems. MARL with centralized shields was proposed and verified in safety games recently. However, centralized shielding approaches can be infeasible in several real-world multi-agent applications that involve non-cooperative agents or communication delay. Thus, we propose to combine MARL with decentralized Control Barrier Function (CBF) shields based on available local information. We establish a safe MARL framework with decentralized multiple CBFs and develop Multi-Agent Deep Deterministic Policy Gradient (MADDPG) to Multi-Agent Deep Deterministic Policy Gradient with decentralized multiple Control Barrier Functions (MADDPG-CBF). Based on a collision-avoidance problem that includes not only cooperative agents but obstacles, we demonstrate the construction of multiple CBFs with safety guarantees in theory. Experiments are conducted and experiment results verify that the proposed safe MARL framework can guarantee the safety of agents included in MARL.

研究の動機と目的

  • 通信遅延や非協力的エージェントの存在により、集中型シャッターが現実のマルチエージェント強化学習(MARL)応用において実用的でない安全上の懸念に対処すること。
  • ローカル情報に基づいて動作する複数の制御バリア関数(CBFs)を用いて、分散的かつスケーラブルなMARLの安全メカニズムを開発すること。
  • 深部決定的方策勾配法とCBFsを統合し、安全でサンプル効率の良いMARLアルゴリズムを構築すること。
  • 提案フレームワークが、協力的エージェントおよび障害物を含むマルチエージェント環境において、安全を保証することを理論的および実験的に検証すること。

提案手法

  • 各エージェントがローカル観測に基づいて協力的および非協力的CBFsを用いる、分散型の複数CBFsを用いた安全MARLフレームワークを提案する。
  • 二次計画法(QPs)を用いて制御則を導出し、CBF制約を満たすように行動を変更することで、安全集合の前向き不変性を保証する。
  • 相対的位置および速度に基づいて、他のエージェント間の相互作用に適した協力的CBFsと、障害物への相互作用に適した非協力的CBFsを設計する。
  • MADDPGアルゴリズムにCBFシャッターメカニズムを統合し、MADDPG-CBFを構築する。これにより、安全を保証しながら方策最適化を維持する。
  • 障害物や他のエージェントへの接近をペナルティ化し、チェックインポイントへの到達を促進するインcentiveを追加したハイブリッド報酬関数を採用する。
  • 2段階の行動修正を採用する:まず、元の方策が行動を生成し、次に、CBFsがQP最適化を用いてこれらの行動を安全集合に射影する。

実験結果

リサーチクエスチョン

  • RQ1集中型シャッターやグローバル通信に依存せずに、分散型の複数CBFsがMARLにおける安全性を保証できるか?
  • RQ2協力的および非協力的CBFsをどのように共同で設計すれば、エージェント間およびエージェント-障害物衝突の両方を処理できるか?
  • RQ3CBFsをMADDPGに統合することで、学習性能を維持しながら、学習中における安全性を保証できるか?
  • RQ4提案フレームワークがマルチエージェント衝突回避シナリオにおいて、理論的にどの程度の安全保証を提供するか?
  • RQ5MADDPG-CBFは、標準のMADDPGと比較して、衝突頻度および累積報酬の観点でどの程度の性能を示すか?

主な発見

  • MADDPG-CBFは、学習開始から安定した平均総報酬約40,000を達成したのに対し、標準のMADDPGは収束に3,200エピソードを要した。
  • MADDPG-CBFの衝突率は、全25,000エピソードにわたり0%であり、5回の独立実行でも衝突が1回も記録されなかった。
  • これに対して、標準のMADDPGは同じ訓練実行で合計12,634回の衝突を経験し、衝突率は50.536%に達した。
  • 軌道可視化により、MADDPG-CBFのエージェントが協調的ステアリングにより、互いの衝突および障害物との衝突を効果的に回避していることが確認された。
  • この手法により、Patrolman IIは全5つのチェックインポイントに到達しながらも安全を維持した。これは、厳密な安全制約下でのタスク完了を示している。
  • CBFsの統合により、サンプル効率と安全性が著しく向上し、学習中に安全違反が一切観察されなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。