[論文レビュー] TLeague: A Framework for Competitive Self-Play based Distributed Multi-Agent Reinforcement Learning
TLeague は、モジュラーな Actor-Learner-InferenceServer アーキテクチャを採用したスケーラブルでクラウドネイティブなフレームワークであり、ハイブリッド CPU-GPU クラスタ上で分散型の競争的自己対戦マルチエージェント強化学習を高スループットで実行可能にします。StarCraft II や ViZDoom といったベンチマークで最大 280 万フレーム/秒の高いスループットと、妥当なスケールアップ性能を達成しており、PPO や V-trace、PBT を用いた相手のサンプリングを含む主流のアルゴリズムをサポートしています。
Competitive Self-Play (CSP) based Multi-Agent Reinforcement Learning (MARL) has shown phenomenal breakthroughs recently. Strong AIs are achieved for several benchmarks, including Dota 2, Glory of Kings, Quake III, StarCraft II, to name a few. Despite the success, the MARL training is extremely data thirsty, requiring typically billions of (if not trillions of) frames be seen from the environment during training in order for learning a high performance agent. This poses non-trivial difficulties for researchers or engineers and prevents the application of MARL to a broader range of real-world problems. To address this issue, in this manuscript we describe a framework, referred to as TLeague, that aims at large-scale training and implements several main-stream CSP-MARL algorithms. The training can be deployed in either a single machine or a cluster of hybrid machines (CPUs and GPUs), where the standard Kubernetes is supported in a cloud native manner. TLeague achieves a high throughput and a reasonable scale-up when performing distributed training. Thanks to the modular design, it is also easy to extend for solving other multi-agent problems or implementing and verifying MARL algorithms. We present experiments over StarCraft II, ViZDoom and Pommerman to show the efficiency and effectiveness of TLeague. The code is open-sourced and available at https://github.com/tencent-ailab/tleague_projpage
研究の動機と目的
- 競争的自己対戦マルチエージェント強化学習(CSP-MARL)は、収束に数十億フレームを要するなど極めて高いデータ効率性を要求するため、その課題に対処すること。
- CPU と GPU からなる異種クラスタ上で大規模かつ分散型の MARL エージェントのトレーニングを可能にし、学習を加速し、トレーニング時間を短縮すること。
- 標準の Kubernetes デプロイメントをサポートするモジュラーで拡張可能なフレームワークを提供し、新しい環境やアルゴリズム、相手のサンプリング戦略に対しても簡単に適応できること。
- 分散環境において高いトレーニングスループットと妥当なスケールアップ性能を達成し、CSP-MARL を研究分野や実世界の応用にさらにアクセスしやすくすること。
提案手法
- 環境との相互作用(データ収集)と学習(勾配更新)を分離する Actor-Learner-InferenceServer アーキテクチャを採用し、並列処理を効率的に行えるようにすること。
- 中央集約型の相手ポールとパラメータサーバーを用いて、多様な相手ポリシーとモデル重みを管理し、PBT や Agent-Exploiter や仮想的自己対戦(Fictitious Self-Play)を用いた動的相手サンプリングを可能にすること。
- PPO や V-trace などのポリシー勾配法を実装し、TCP を介した Horovod による allreduce を用いた同期的勾配更新により、価値関数とポリシーの学習を実現すること。
- シンプルな順方向伝播から複雑な DAG まで柔軟なニューラルネットワークアーキテクチャをサポートし、新しいモデルの統合が容易なモジュラー設計を採用すること。
- 標準の Kubernetes を用いてオーケストレーションを実装し、パブリックまたはプライベートクラウドインfra上で動的スケーリングを可能にするクラウドネイティブなデプロイメントを実現すること。
- ブロッキングキューを用いたデータフロー最適化により、アクターとランナのスループットをバランスさせ、データラグを最小限に抑え、ポリシーに適合した学習の忠実性を保証すること。
実験結果
リサーチクエスチョン
- RQ1モジュラーで分散型のフレームワークは、競争的自己対戦マルチエージェント強化学習環境における高性能な MARL エージェントのトレーニングに要するウォールクロック時間を顕著に短縮できるか?
- RQ2CPU と GPU からなる異種クラスタは、マルチエージェント強化学習におけるトレーニングスループットのスケーリングにどの程度効果的に活用できるか?
- RQ3本フレームワークは、新しい環境、強化学習アルゴリズム、相手のサンプリング戦略への拡張性をどの程度備えているか?
- RQ4標準のクラウドインfraを用いて、StarCraft II や ViZDoom といった実世界のベンチマークでどの程度のスループットとスケールアップ性能を達成できるか?
- RQ5高いデータスループットと分散トレーニングにもかかわらず、フレームワークはポリシーに適合した学習の質をどの程度維持できるか?
主な発見
- TLeague は、Dota 2 1v1 の設定で、192 個の GPU と 60,000 個の CPU コアを用いて、ピークスループットとして 280 万フレーム/秒(rfps)と 560 万フレーム/秒(cfps)を達成しました。
- StarCraft II の TStarBot-X パラメータ設定では、96 個の GPU と 4,200 個の CPU コアを用いて 4,200 cfps を継続的に維持し、1 チーム(Zerg)のレースでの強力なスケールアップ性能を示しました。
- ViZDoom では、32 個の GPU と 1,152 個の CPU コアを用いて 8,200 cfps を達成し、フレームスキップ=2 の条件下で 17.5 in-game フレーム/秒の処理速度を実現しました。
- 数百の GPU と数万の CPU コアを用いた環境でも、cfps/rfps の比が 1.0 に近いことから、最小限のデータラグと高いポリシー適合性を実現し、妥当なスケールアップ性能を示しました。
- TLeague は、StarCraft II(zvz フルゲーム)、ViZDoom(CIG 2016 トラック 1)、Pommerman(NeurIPS 2018 2vs2 コンペティション)で強力なパフォーマンスを発揮するエージェントを成功裏にトレーニングし、その有効性を検証しました。
- オープンソースのフレームワークはプロダクション環境で利用可能であり、Tencent Cloud を含む主要なクラウドプロバイダーとの統合も可能にしています。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。