Skip to main content
QUICK REVIEW

[論文レビュー] A Structured Prediction Approach for Generalization in Cooperative Multi-Agent Reinforcement Learning

Nicolas Carion, Gabriel Synnaeve|arXiv (Cornell University)|Oct 19, 2019
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

本論文は、学習済みスコアリングモデルを用いた集中最適化手順を用いてエージェントをタスクに割り当てる構造的予測アプローチを提案し、より大きな問題インスタンスへのゼロショット一般化を可能にする共同マルチエージェント強化学習の手法を提示している。この手法は、トレーニング時に観察されたものよりも最大5倍のエージェントとタスクを含むStarCraft: Brood Warのシナリオにおいて、強力なベースラインを上回る性能を発揮した。

ABSTRACT

Effective coordination is crucial to solve multi-agent collaborative (MAC) problems. While centralized reinforcement learning methods can optimally solve small MAC instances, they do not scale to large problems and they fail to generalize to scenarios different from those seen during training. In this paper, we consider MAC problems with some intrinsic notion of locality (e.g., geographic proximity) such that interactions between agents and tasks are locally limited. By leveraging this property, we introduce a novel structured prediction approach to assign agents to tasks. At each step, the assignment is obtained by solving a centralized optimization problem (the inference procedure) whose objective function is parameterized by a learned scoring model. We propose different combinations of inference procedures and scoring models able to represent coordination patterns of increasing complexity. The resulting assignment policy can be efficiently learned on small problem instances and readily reused in problems with more agents and tasks (i.e., zero-shot generalization). We report experimental results on a toy search and rescue problem and on several target selection scenarios in StarCraft: Brood War, in which our model significantly outperforms strong rule-based baselines on instances with 5 times more agents and tasks than those seen during training.

研究の動機と目的

  • 大規模な問題インスタンスにスケーリングする際、集中型マルチエージェント強化学習手法における一般化の欠如を解決すること。
  • マルチエージェント協調(MAC)問題における局所性と協調構造を活用し、効率的な学習と転移を可能にすること。
  • 再トレーニングなしで問題サイズにわたる一般化を実現する高レベルのエージェント-タスク割り当てポリシーの開発。
  • 構造的予測を用いて、遠く離れたタスクにエージェントを分散配置する、または集中的な攻撃にグループ化するといった複雑な協調パターンをモデル化すること。
  • StarCraft: Brood Warのようなリアルタイムストラテジー・ゲームに適したリアルタイム推論性能を達成すること。

提案手法

  • マルチエージェントポリシーを高レベルの割り当てポリシーと低レベルの行動ポリシーに分解し、前者の学習に焦点を当てる。
  • エージェント-タスクの割り当ては、学習済みスコアリングモデルによってパrameter化された集中型最適化問題(推論手順)によって計算される。
  • スコアリングモデルは線形項と二次項を用い、即時の協調を表すエージェント-タスクスコアと、長期的協調パターンを表すタスク-タスクスコアを含む。
  • 推論手順は多項式時間内に実行可能であり、多数のエージェントとタスクへの効率的なスケーリングを可能にする。
  • モデルは小規模なMAC問題インスタンスで学習され、その後、トレーニング時に観察されなかった大規模なインスタンスに直接適用される(ゼロショット一般化)。
  • 線形プログラミング(LP)、二次最適化(Quad)、およびAMaxを含む、異なる推論手順とスコアリングモデルの組み合わせが評価された。

実験結果

リサーチクエスチョン

  • RQ1学習済みスコアリングモデルを用いた構造的予測アプローチは、小規模な問題インスタンスから大規模なインスタンスへの有効なマルチエージェント協調ポリシーの一般化を可能にするか?
  • RQ2学習済みスコアを用いた集中型最適化手順は、フォーカスファイアリングや空間的分散といった複雑な協調パターンをどれほど正確に捉えることができるか?
  • RQ3目的関数に二次項を含めることで、長期的協調を要するシナリオにおける一般化性能が向上するか?
  • RQ4本手法は、StarCraft: Brood Warのような複雑なリアルタイムストラテジー・ゲームにおいてもリアルタイム性能を達成できるか?
  • RQ5問題サイズの変動にわたるゼロショット一般化の観点から、本手法はルールベースのベースラインと比べてどの程度優れているか?

主な発見

  • m10v10 StarCraftシナリオでは、本手法が中央値で0.94の勝率を達成し、最良のヒューリスティック(0.83)および他のベースラインを大きく上回った。
  • w60v67シナリオでは、Quadモデルが0.33の勝率を記録し、最良のヒューリスティック(0.13)を上回り、効果的なゼロショット一般化を示した。
  • Wraithバトル設定のような長期的協調が求められるシナリオでは、二次推論手順(Quad)がLPおよびAMaxを著しく上回った。ここではフォーカスファイアリングが重要である。
  • 衝突が頻発するシナリオ(例:Zergling-Hydralisk(zh))では、協調要件が単純なためLPモデルが良好に機能したが、Quadモデルは一般化がうまくいかず、環境的制約に敏感であることが示された。
  • 最大のシナリオ(80 vs 82ユニット)において、アルゴリズムは1回の意思決定あたり500ms未満で実行され、StarCraft: Brood Warにおけるリアルタイムプレイを可能にした。
  • 本モデルは、トレーニング時に観察されたものよりも最大5倍のエージェントとタスクを含むインスタンスへも一般化でき、強力なゼロショット一般化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。