Skip to main content
QUICK REVIEW

[論文レビュー] TiZero: Mastering Multi-Agent Football with Curriculum Learning and Self-Play

Fanqi Lin, Shi‐Yu Huang|arXiv (Cornell University)|Feb 15, 2023
Sports Analytics and PerformanceEconomics, Econometrics and Finance被引用数 3
ひとこと要約

TiZeroは、適応的カリキュラム学習、画期的な挑戦・一般化自己対戦戦略、および共同政策最適化を用いて、熟練者の指導なしに11対11のGoogle Research Football環境を完全に習得する自己進化型マルチエージェント強化学習システムを導入する。これにより、先行手法よりも30%以上の勝率向上を達成し、複雑なマルチエージェント環境における優れた協調性と戦略的計画性を示している。

ABSTRACT

Multi-agent football poses an unsolved challenge in AI research. Existing work has focused on tackling simplified scenarios of the game, or else leveraging expert demonstrations. In this paper, we develop a multi-agent system to play the full 11 vs. 11 game mode, without demonstrations. This game mode contains aspects that present major challenges to modern reinforcement learning algorithms; multi-agent coordination, long-term planning, and non-transitivity. To address these challenges, we present TiZero; a self-evolving, multi-agent system that learns from scratch. TiZero introduces several innovations, including adaptive curriculum learning, a novel self-play strategy, and an objective that optimizes the policies of multiple agents jointly. Experimentally, it outperforms previous systems by a large margin on the Google Research Football environment, increasing win rates by over 30%. To demonstrate the generality of TiZero's innovations, they are assessed on several environments beyond football; Overcooked, Multi-agent Particle-Environment, Tic-Tac-Toe and Connect-Four.

研究の動機と目的

  • 熟練者の指導なしに、複雑な11対11のGoogle Research Football環境で強力なマルチエージェント方策を訓練する課題に対処すること。
  • マルチエージェント強化学習における主な障壁である、マルチエージェント協調、長期的計画、疎な報酬、非推移的ダイナミクスを克服すること。
  • 10名のフィールドプレーヤーが競争的で確率的な環境で効果的に協調できる、スケーラブルで分散型の訓練フレームワークを構築すること。
  • フットボールを超えた分野における手法の一般性を実証するために、Overcooked、MPE、Tic-Tac-Toe、Connect-Fourで評価すること。
  • カリキュラム学習と画期的な自己対戦戦略を組み合わせることで、11対11モードで最先端のパフォーマンスを達成すること。

提案手法

  • 複数のエージェントを同時に訓練することで協調性と共有政策のパフォーマンスを向上させる共同政策最適化目的関数を導入する。
  • 環境の複雑さを段階的に増加させる適応的カリキュラム学習を採用し、訓練の安定性を高め、方策収束を加速する。
  • 強い相手と多様で一般化可能な方策の両方と対戦することで、耐性を高める「挑戦・一般化」自己対戦戦略を設計する。
  • 動的に進化する自己対戦相手プールを活用し、エージェントが幅広い戦略に直面できるようにし、過剰適合を低減する。
  • 効率的なマルチエージェントの責任帰属と方策最適化を可能にする、集中型訓練・分散型実行(CTDE)パラダイムを採用する。
  • パrameter効率性と方策特化性の両立を図るため、共有エンコーダーヘッドと個別価値ヘッドを備えた深層ニューラルネットワークアーキテクチャを活用する。
Figure 1. Screenshot of Google Research Football. TiZero’s agents outperform previous systems by leveraging more coordinated strategies, such as passing more often and creating more assists.
Figure 1. Screenshot of Google Research Football. TiZero’s agents outperform previous systems by leveraging more coordinated strategies, such as passing more often and creating more assists.

実験結果

リサーチクエスチョン

  • RQ1熟練者の指導なしに、マルチエージェント強化学習システムが11対11のGoogle Research Football環境で人間を超えるパフォーマンスを達成できるか?
  • RQ2適応的カリキュラム学習は、複雑なマルチエージェント環境における訓練の安定性とサンプル効率をどのように向上させるか?
  • RQ3標準的な自己対戦と比較して、「挑戦・一般化」自己対戦戦略は、方策の多様性と耐性をどの程度高めるか?
  • RQ4共同政策最適化目的関数は、マルチエージェント協調性と長期的戦略的計画を顕著に向上させられるか?
  • RQ5提案された手法的革新は、フットボールを超えた多様なマルチエージェント環境において、どの程度一般化可能か?

主な発見

  • TiZeroは、11対11のGoogle Research Football環境において、先行手法と比較して勝率が30%以上向上し、ゴール差の改善も顕著に見られた。
  • 従来のベースラインと比較して、パス頻度の増加やアシスト作成の向上など、優れた協調性を示した。
  • 「挑戦・一般化」自己対戦戦略はTic-Tac-Toeで8.11の多様性インデックスを達成し、ベースライン(6.65〜7.19)を上回り、より多様で耐性のある相手方策を示した。
  • 10プレーヤーのGFootball設定において、MAPPO(196 GB)と比較してGPUメモリ消費量を38%削減(121 GB)し、スケーラビリティの向上を実証した。
  • 多様な環境評価において、TiZeroはOvercooked、MPE、Tic-Tac-Toe、Connect-Fourで最先端の手法を上回るか同等のパフォーマンスを示し、手法の一般性を確認した。
  • 訓練曲線から、TiZeroはすべてのベンチマークでMAPPO、MAT、QMIXと比較して収束が早く、最終パフォーマンスも高く、壁時計時間での訓練が速いことが示された。
Figure 2. TiZero’s network architecture. Six types of information are required as input: the controlled player information, player ID, ball information, teammate information, opponent information and current match information. We use six separate MLPs with two (one for the ”player ID”) fully-connect
Figure 2. TiZero’s network architecture. Six types of information are required as input: the controlled player information, player ID, ball information, teammate information, opponent information and current match information. We use six separate MLPs with two (one for the ”player ID”) fully-connect

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。