Skip to main content
QUICK REVIEW

[論文レビュー] Feudal Multi-Agent Hierarchies for Cooperative Reinforcement Learning

Sanjeevan Ahilan, Peter Dayan|arXiv (Cornell University)|Jan 24, 2019
Reinforcement Learning in Robotics参考文献 37被引用数 21
ひとこと要約

本稿では、複数のワーカーエージェントに部分的目標を通信することで協調学習を可能にする、分散型強化学習フレームワーク「フェウダリズム・マルチエージェント・ハイアラルキー(FMH)」を提案する。グローバル報酬をマネージャーに限定し、ワーカーには部分的目標に基づく報酬を適用することで、特に高次元のマルチエージェント環境において、中央集権的または完全に分散型の手法と比較して、協調性、スケーラビリティ、学習安定性が向上する。

ABSTRACT

We investigate how reinforcement learning agents can learn to cooperate. Drawing inspiration from human societies, in which successful coordination of many individuals is often facilitated by hierarchical organisation, we introduce Feudal Multi-agent Hierarchies (FMH). In this framework, a 'manager' agent, which is tasked with maximising the environmentally-determined reward function, learns to communicate subgoals to multiple, simultaneously-operating, 'worker' agents. Workers, which are rewarded for achieving managerial subgoals, take concurrent actions in the world. We outline the structure of FMH and demonstrate its potential for decentralised learning and control. We find that, given an adequate set of subgoals from which to choose, FMH performs, and particularly scales, substantially better than cooperative approaches that use a shared reward function.

研究の動機と目的

  • 協調的マルチエージェント強化学習における非定常性、報酬割り当て、スケーラビリティの課題に対処すること。
  • 人間社会にインspiredされた階層的組織が、マルチエージェントシステムにおける協調性と学習効率を向上させられるかどうかを検討すること。
  • 完全な状態共有に依存せずに、マネージャーによる部分的目標の通信を通じて、効果的な協調性を実現する分散型学習を可能にすること。
  • 報酬に基づく階層的構造が、共有報酬や中央集権的学習アプローチを上回ることを、複雑なマルチエージェントタスクにおいて示すこと。

提案手法

  • 上位に1つのマネージャーエージェントを置いた階層的構造を定義し、グローバルタスク報酬を最大化する責任を負わせる。
  • マネージャーは複数のワーカーエージェントに部分的目標を通信し、ワーカーはグローバル報酬ではなく、これらの部分的目標の達成に基づいて報酬を得る。
  • ワーカーは独立して動作し、環境で同時に行動を取る。観測には通信された部分的目標が含まれる。
  • 部分的目標から報酬へのマッピングは事前に指定され、マネージャーの通信をワーカー固有の報酬関数に変換する。
  • 深層強化学習(DDPG)を用いて学習を行い、目標設定行動の学習安定化のため、事前学習と繰り返し通信を実施する。
  • 階層的報酬構造による協調性を維持しつつ、分散型学習をサポートする。

実験結果

リサーチクエスチョン

  • RQ1マネージャー・ワーカーの階層的構造は、協調的マルチエージェント強化学習における協調性とスケーラビリティを向上させられるか?
  • RQ2部分的目標に基づく報酬分解は、共有グローバル報酬と比較して、学習安定性と性能にどのように影響するか?
  • RQ3階層的通信を用いた分散型学習は、マルチエージェント環境において中央集権的学習をどの程度上回れるか?
  • RQ41人のマネージャーのもとで複数のワーカーが同時に動作する場合、学習効率と収束性にどのような影響を与えるか?

主な発見

  • FMHは、タスクパフォーマンスとスケーラビリティの観点で、分散型および中央集権的協調的マルチエージェント強化学習手法を著しく上回る。
  • 部分的目標に基づく報酬により、ワーカーのポリシーが予測可能になるため、学習中の非定常性が軽減される。
  • 完全な観測共有がなくても、複数のワーカー間での効果的な協調が可能であり、分散環境における頑健性が示された。
  • 多くのエージェントや多くの可能な部分的目標に対しても、システムの複雑さが増しても高いパフォーマンスを維持できるスケーラビリティを有する。
  • 事前学習と繰り返し通信により、マネージャーにおける目標設定行動の学習が向上し、全体のシステム安定性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。