Skip to main content
QUICK REVIEW

[論文レビュー] Extended Markov Games to Learn Multiple Tasks in Multi-Agent Reinforcement Learning

Borja G. León, Francesco Belardinelli|arXiv (Cornell University)|Feb 14, 2020
Reinforcement Learning in Robotics参考文献 35被引用数 11
ひとこと要約

本稿では、複数の強化学習エージェントが同時に非マルコフ型の仕様(co-safe LTLで表現)を満たしながら学習できる形式的枠組み、拡張マルコフゲーム(EMG)を導入する。LPOPL や I-LPOPL といった論理ベースの強化学習アルゴリズムをマルチエージェント設定に拡張することで、多様な時系列論理タスクにおける協調的ポリシー学習を可能にする。実験的結果では、エージェント間の協調による性能向上が示されたが、計算コストの増加を伴う。

ABSTRACT

The combination of Formal Methods with Reinforcement Learning (RL) has recently attracted interest as a way for single-agent RL to learn multiple-task specifications. In this paper we extend this convergence to multi-agent settings and formally define Extended Markov Games as a general mathematical model that allows multiple RL agents to concurrently learn various non-Markovian specifications. To introduce this new model we provide formal definitions and proofs as well as empirical tests of RL algorithms running on this framework. Specifically, we use our model to train two different logic-based multi-agent RL algorithms to solve diverse settings of non-Markovian co-safe LTL specifications.

研究の動機と目的

  • マルチエージェントシステムにおいて、複数の非マルコフ型タスク仕様を満たすように複数の強化学習エージェントを訓練する課題に対処すること。
  • 時系列論理と報酬マシンといった形式的手法を、スケーラブルで安全かつ協調的なポリシー学習を可能にするマルチエージェント強化学習に拡張すること。
  • マルコフゲームを一般化し、敵対的または単一タスク設定にとどまらない多様な時系列論理仕様をサポートする一般化された数学的モデル、拡張マルコフゲーム(EMG)を形式化すること。
  • 協調的環境におけるco-safe LTL仕様の下で、論理誘導型マルチエージェントRLアルゴリズムを用いて、フレームワークを実験的に検証すること。
  • 動的カリキュラム学習を用いたマルチエージェント設定における、学習速度、計算コスト、パフォーマンスのトレードオフを調査すること。

提案手法

  • co-safe LTL仕様から導出される決定的有限オートマトン(DFA)を用いて、非マルコフ型報酬構造を統合した、マルコフゲームの一般化として拡張マルコフゲーム(EMG)を提案する。
  • LTL仕様から報酬マシンおよびDFAへの形式的マッピングを導入し、マルチエージェント環境における非マルコフ型タスクの報酬形状を可能にする。
  • 単エージェント用論理ベースのRLアルゴリズム(LPOPL および I-LPOPL)をマルチエージェント版(I-LPOPL)に拡張し、共有される時系列論理制約のもとでの独立学習を可能にする。
  • エージェントを順次異なる仕様で訓練するカリキュラム学習戦略を採用し、全タスクでグリーディポリシーの下で性能を評価する。
  • 各エージェントおよび各仕様(または部分仕様)に個別のQネットワークを採用し、訓練中に現在の行動ポリシーに同期してポリシー更新を行う。
  • モデル検査および形式的検証の原則を用いて、学習されたポリシーが指定されたLTL特性(特にco-safe LTL)を満たしていることを保証する。

実験結果

リサーチクエスチョン

  • RQ1形式的手法を用いて、マルチエージェント強化学習を、複数の非マルコフ型仕様を満たすように効果的に拡張できるか?
  • RQ2co-safe LTLにおける時系列論理仕様を、マルチエージェント学習フレームワークに形式的に統合し、ポリシー最適化を誘導するにはどうすればよいか?
  • RQ3論理ベースの単エージェントRLアルゴリズムをマルチエージェント設定に拡張する際の、パフォーマンスとスケーラビリティのトレードオフは何か?
  • RQ4共有報酬構造を通じて複数のLTL仕様を学習する際、マルチエージェントシステムでエージェントの協調行動はどのように生じるか?
  • RQ5トレーニングカリキュラムおよびポリシー更新戦略の選択が、マルチエージェント論理誘導型RLにおける学習安定性とパフォーマンスに与える影響は何か?

主な発見

  • I-LPOPLは、1人のエージェントがアイテムを取得し、もう1人が道具を備えて待機するといった協調戦略により、LPOPLよりもマルチエージェント設定で優れた性能を示す。
  • I-DQN-lは、単エージェントマップにおいてDQN-lよりも高い報酬を得ており、タスク実行におけるマルチエージェント協調の利点を示している。
  • I-LPOPLでは、50kステップ目以降に性能が低下する。これは、アクティブな行動ポリシーを使用せずにネットワークを更新する際の協調ポリシーの忘却に起因し、ポリシー安定性の課題を示している。
  • I-LPOPLは、1エージェントあたりの部分仕様ごとにDQNを保持するため、I-DQN-l(1.57–2.15時間)に比べて著しく長い計算時間(11.32–14.28時間)を要する。
  • 本フレームワークは、順序付きおよび順序なしタスクセットを含む多様なco-safe LTL仕様を満たすようにマルチエージェントシステムが学習できることを実証しており、3回の独立実験における平均報酬曲線およびパーセンタイルから検証された。
  • 結果から、形式的手法がマルチエージェントRLに効果的に統合可能であり、EMGがこのような拡張の一般化された数学的基盤を提供することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。