Skip to main content
QUICK REVIEW

[論文レビュー] Reward Machines for Cooperative Multi-Agent Reinforcement Learning

Cyrus Neary, Zhe Xu|arXiv (Cornell University)|Jul 3, 2020
Reinforcement Learning in Robotics参考文献 37被引用数 19
ひとこと要約

本論文では、タスク構造を符号化する報酬マシン(RMs)—メーリー機械—を用いて、協調的マルチエージェント強化学習(MARL)タスクを個々のエージェントのための部分タスクに分解することを提案する。分散型Q学習アルゴリズムを用いてエージェントを個別に学習させることで、検証可能な分解条件を満たすことでチーム全体のタスク達成を保証し、中央集権的学習よりも1桁速い収束を達成するとともに、離散的環境において階層的および独立型Q学習のベースラインを上回る性能を発揮する。

ABSTRACT

In cooperative multi-agent reinforcement learning, a collection of agents learns to interact in a shared environment to achieve a common goal. We propose the use of reward machines (RM) -- Mealy machines used as structured representations of reward functions -- to encode the team's task. The proposed novel interpretation of RMs in the multi-agent setting explicitly encodes required teammate interdependencies, allowing the team-level task to be decomposed into sub-tasks for individual agents. We define such a notion of RM decomposition and present algorithmically verifiable conditions guaranteeing that distributed completion of the sub-tasks leads to team behavior accomplishing the original task. This framework for task decomposition provides a natural approach to decentralized learning: agents may learn to accomplish their sub-tasks while observing only their local state and abstracted representations of their teammates. We accordingly propose a decentralized q-learning algorithm. Furthermore, in the case of undiscounted rewards, we use local value functions to derive lower and upper bounds for the global value function corresponding to the team task. Experimental results in three discrete settings exemplify the effectiveness of the proposed RM decomposition approach, which converges to a successful team policy an order of magnitude faster than a centralized learner and significantly outperforms hierarchical and independent q-learning approaches.

研究の動機と目的

  • 協調的マルチエージェント強化学習(MARL)における協調性と非定常性の課題に対処すること。
  • エージェントごとに報酬マシン(RMs)として符号化された部分タスクにグローバルチームタスクを分解することで、分散型学習を可能にすること。
  • 部分タスクの完了がグローバルタスク実行に成功することを保証するアルゴリズム的に検証可能な条件を提供すること。
  • エージェントがローカル状態と抽象化されたチームメイトの情報のみを用いて学習する分散型Q学習アルゴリズムを構築すること。
  • 特に報酬が疎で時間的に遅延する環境において、スケーラビリティとサンプル効率性を示すこと。

提案手法

  • チームの協調的タスクを、タスク仕様における時間的・論理的依存関係を符号化する報酬マシン(RM)として表現する。
  • 各エージェントに部分タスクRMを割り当てる新しいRM分解法を定義し、必要な相互依存関係とチームメイト情報が明示的に符号化されるようにする。
  • 各エージェントがその部分タスクRMを完了すれば、連携行動が元のグローバルタスクを達成することを保証する条件を導入する。
  • エージェントがローカル状態と抽象化されたチームメイト信号のみを用いて部分タスクRMを学習する分散型Q学習アルゴリズムを設計し、同時に学習を避ける。
  • 割引なし報酬の場合、グローバル価値関数をバインドする局所的価値関数を導出し、性能解析と収束保証を可能にする。
  • 離散的環境では表形式Q学習を用い、連続的設定への拡張は深層ネットワークへの応用を示唆する。

実験結果

リサーチクエスチョン

  • RQ1報酬マシンは、チーム全体のタスク正しさを保ちつつ、分散型学習を可能にする部分タスクに協調的マルチエージェントタスクを分解するために利用可能か?
  • RQ2個々のエージェントが部分タスクを完了することで、グローバル協調的タスクが正常に実行されることが保証されるための形式的条件は何か?
  • RQ3提案された分散型RMベースの学習アプローチは、中央集権的、階層的、独立型Q学習のベースラインと比較して、サンプル効率性と収束速度においてどの程度優れているか?
  • RQ4エージェントは、リアルタイムの協調や同時に学習する必要がなく、ローカル状態と抽象化されたチームメイト情報のみを用いて効果的な方策を学習できるか?
  • RQ5RMの部分タスクへの分解が、報酬が疎で時間的に遅延する環境において、マルチエージェント環境のスケーラビリティをどの程度向上できるか?

主な発見

  • 提案された分散型アルゴリズムは、2エージェントの合流タスクにおいて、中央集権的学習よりも1桁以上速い速度で成功したチーム方策に収束した。
  • 10エージェントの合流タスクでは、提案手法は効果的なチーム行動を学習したが、階層的独立Q学習(h-IL)および独立Q学習(IQL)は訓練予算内に収束しなかった。
  • RM分解フレームワークにより、エージェントは独立して学習可能となり、同時に学習による非定常性の問題が解消された。
  • 3つの離散的環境において、提案手法は階層的および独立型Q学習の両方を顕著に上回る性能を発揮した。
  • 割引なし報酬の場合、部分タスクRMから導出された局所的価値関数は、グローバル価値関数の証明可能な下界と上界を提供し、理論的解析を可能にした。
  • 本手法は特に報酬が疎で時間的に遅延するタスクにおいて、強力なスケーラビリティとサンプル効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。