Skip to main content
QUICK REVIEW

[論文レビュー] Randomized Entity-wise Factorization for Multi-Agent Reinforcement Learning

Shariq Iqbal, Christian A. Schroeder de Witt|arXiv (Cornell University)|Jun 7, 2020
Reinforcement Learning in Robotics参考文献 48被引用数 15
ひとこと要約

本稿では、想像的観測とタスク間の共有パターン学習を通じて一般化性能を向上させる、想像的学習のためのランダム化エンティティ別因子分解(REFIL)を提案する。この手法は、エージェントおよびエンティティの部分集合をランダムにサンプリングして価値関数を因子分解させることで、変動するチーム編成を伴う複雑なスターフィートのミクロマネジメント環境において、強力なベースラインを上回る性能を達成する。

ABSTRACT

Multi-agent settings in the real world often involve tasks with varying types and quantities of agents and non-agent entities; however, common patterns of behavior often emerge among these agents/entities. Our method aims to leverage these commonalities by asking the question: ``What is the expected utility of each agent when only considering a randomly selected sub-group of its observed entities?'' By posing this counterfactual question, we can recognize state-action trajectories within sub-groups of entities that we may have encountered in another task and use what we learned in that task to inform our prediction in the current one. We then reconstruct a prediction of the full returns as a combination of factors considering these disjoint groups of entities and train this ``randomly factorized" value function as an auxiliary objective for value-based multi-agent reinforcement learning. By doing so, our model can recognize and leverage similarities across tasks to improve learning efficiency in a multi-task setting. Our approach, Randomized Entity-wise Factorization for Imagined Learning (REFIL), outperforms all strong baselines by a significant margin in challenging multi-task StarCraft micromanagement settings.

研究の動機と目的

  • 変動するエージェントおよびエンティティの数や種別を伴うマルチエージェント強化学習(MARL)において、一般化可能なポリシーを学習する課題に対処すること。
  • エージェントの部分集合における共通の行動パターンを同定することで、異なるチーム編成を有するタスク間での知識移譲を可能にすること。
  • タスク構造や固定グループingsに関する事前知識が不要な状態で、協調的MARLにおける学習効率および一般化性能を向上させること。
  • 補助的価値関数因子分解目的を通じて、タスク間の共有構造的パターンを活用する訓練パラダイムを構築すること。

提案手法

  • 訓練中に観測されたエンティティをランダムに不重複な部分集合に分割して、部分観測をシミュレートする。
  • 想像された部分集合シナリオにおける効用を予測する価値関数を訓練することで、サブ構造(サッカーにおける「抜け出し」やスターフィートにおけるユニット編成など)から再利用可能なパターンを学習するようモデルを促進する。
  • 完全なリターンは、想像された部分集合要因と外部要因を考慮する相互作用項の組み合わせとして再構成される。
  • 注意機構を用いたモデルに学習可能なマスクを導入することで、エンティティ別因子分解を効率的に実装する。
  • 因子化された価値関数は、主な価値関数損失とともに補助的目的として訓練され、表現力は保持されたまま、知識共有を促進する。
  • 部分集合が独立または最適でなくてもよいことから、あらゆる繰り返し発生するサブ構造からの学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1エンティティのランダム部分集合の因子分解は、マルチタスクマルチエージェント強化学習における一般化性能を向上させるか?
  • RQ2想像された部分観測からの学習は、多様なチーム編成にわたる再利用可能な行動パターンをどれほど効果的に捉えるか?
  • RQ3ランダムにサンプリングされたエンティティ部分集合にわたり効用を因子分解する価値関数は、複雑な協調的MARL環境における性能をどの程度向上させるか?
  • RQ4提案された補助訓練目的は、モデルの表現力に損なわれることなく、学習効率および転送性を向上させるか?

主な発見

  • REFILは、変動するチーム編成を伴う挑戦的なマルチタスクスターフィートミクロマネジメント環境において、すべての強力なベースラインを顕著に上回る。
  • エージェントおよびエンティティのランダムにサンプリングされた部分集合から共有パターンを学習することで、多様なタスクにおける一般化性能が向上する。
  • 補助的因子分解目的は学習効率を向上させ、収束速度の向上とより優れたサンプル複雑性を実現する。
  • 部分集合が完全に独立でない場合でも、本手法は非最適なサンプリングに対して頑健であることを示しており、効果的な一般化を実現している。
  • アテンションベースのマスクの使用により、可変サイズの入力設定においてエンティティ別因子分解を効率的に実装できる。
  • 実験的結果から、モデルは単純なチーム構成からより複雑な構成へと知識を転送でき、繰り返し発生するサブ構造パターンを認識していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。