Skip to main content
QUICK REVIEW

[論文レビュー] TiKick: Towards Playing Multi-agent Football Full Games from Single-agent Demonstrations

Shiyu Huang, Wenze Chen|arXiv (Cornell University)|Oct 9, 2021
Sports Analytics and Performance参考文献 40被引用数 8
ひとこと要約

TiKickは、Google Research Footballにおける単一エージェントの専門家デモンストレーションから、エンドツーエンドのオフライン強化学習フレームワークを用いてマルチエージェントフットボールAIを訓練する。自己対戦による単一エージェント専門家から得た大規模なリプレイデータセットと、新しいアルゴリズム的要素を組み込んだ分散型オフライン学習パイプラインを活用することで、TiKickはフルゲームプレイにおいて最先端のパフォーマンスを達成し、より低いサンプル複雑性で下流のマルチエージェント強化学習の訓練を加速する。

ABSTRACT

Deep reinforcement learning (DRL) has achieved super-human performance on complex video games (e.g., StarCraft II and Dota II). However, current DRL systems still suffer from challenges of multi-agent coordination, sparse rewards, stochastic environments, etc. In seeking to address these challenges, we employ a football video game, e.g., Google Research Football (GRF), as our testbed and develop an end-to-end learning-based AI system (denoted as TiKick) to complete this challenging task. In this work, we first generated a large replay dataset from the self-playing of single-agent experts, which are obtained from league training. We then developed a distributed learning system and new offline algorithms to learn a powerful multi-agent AI from the fixed single-agent dataset. To the best of our knowledge, Tikick is the first learning-based AI system that can take over the multi-agent Google Research Football full game, while previous work could either control a single agent or experiment on toy academic scenarios. Extensive experiments further show that our pre-trained model can accelerate the training process of the modern multi-agent algorithm and our method achieves state-of-the-art performances on various academic scenarios.

研究の動機と目的

  • Google Research Football (GRF) のような複雑で報酬が疎らで確率的な環境におけるマルチエージェント連携の課題に対処すること。
  • 従来の研究では単一エージェントの制御しかできなかったり、簡素化された学術的シナリオでのみ動作していたという制限を克服すること。
  • 単一エージェント専門家のオフラインデータのみを用いて、11人プレーヤーのフルGRFゲームをマスターできるスケーラブルでエンドツーエンドの学習システムを開発すること。
  • 事前学習済みのオフラインモデルを初期化として活用することで、現代のマルチエージェント強化学習を加速すること。
  • 単一専門家トレーラーからのオフライン模倣学習と強化学習が、高パフォーマンスで一般化可能なマルチエージェント方策を生み出せることを実証すること。

提案手法

  • リーグトレーニングの設定下で、訓練済みの単一エージェント専門家同士の自己対戦から大規模なリプレイデータセットを生成した。
  • 固定された単一エージェントデモンストレーションデータからマルチエージェント方策を学習する分散型オフライン強化学習システムを設計した。
  • マルチエージェント設定に特化した新しいオフライン強化学習アルゴリズムを提案し、行動クラッシングや価値正則化などの技術を組み込んで学習の安定化を図った。
  • マルチエージェント学習の基盤としてMAPPOアルゴリズムを採用し、オフラインモデルからの事前学習済み重みを初期化として使用した。
  • 異なるアクション空間を想定したシナリオへの移行時に、最終層の重みを凍結するなどのアーキテクチャ的変更を適用した。
  • カリキュラムスタイルの評価とTrueSkillレーティングを用いて、多様なシナリオや相手に対してパフォーマンスをベンチマークした。

実験結果

リサーチクエスチョン

  • RQ1単一エージェントのデモンストレーションからのオフライン強化学習が、11人プレーヤーのGoogle Research Footballゲームを完全にマスターできるマルチエージェント方策を学習できるか?
  • RQ2事前学習済みのオフラインモデルは、現代のマルチエージェント強化学習アルゴリズムの訓練をどの程度加速できるか?
  • RQ3単一専門家トレーラーからのオフライン模倣学習と強化学習は、マルチエージェント連携を要する複雑で報酬が疎らで確率的な環境にどの程度一般化できるか?
  • RQ4オフライン事前学習を用いることで、マルチエージェント強化学習におけるサンプル効率とパフォーマンス向上は、ランダム初期化やランダムアクター初期化と比べてどの程度顕著か?
  • RQ5提案手法は、GRFにおけるフルゲームと学術的シナリオの両方で、既存手法を上回る性能を示せるか?

主な発見

  • TiKickは、単一エージェント専門家のオフラインデータのみを用いて、11人プレーヤーのGoogle Research Footballゲームを完全にマスターした初めての学習ベースのAIシステムである。
  • 事前学習済みTiKickモデルは、下流のマルチエージェント強化学習の訓練を顕著に加速し、5つの学術的シナリオのうち4つで100万ステップの訓練内に最高スコアを達成した。
  • 5つのすべてのGRF学術的シナリオにおいて、QMIX、MADDPG、CDS、MAPPOを含むベースラインと比較して、最高のパフォーマンスと最小のサンプル複雑性を達成した。
  • 最終的なTiKickモデルは、すべての評価対象アルゴリズムの中で最高のTrueSkillレーティングを記録し、組み込みAI相手に対する優位性と一貫性を裏付けた。
  • 本手法は強力な一般化性能を示し、相手が非常に動的かつ多数に及ぶような挑戦的なシナリオ(Hard_Counter-attack)でも、ベースラインを上回った。
  • アブレーションスタディにより、オンラインインタラクションを伴わない単一専門家デモンストレーションからのオフライン事前学習でも、高パフォーマンスなマルチエージェント方策を獲得できることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。