Skip to main content
QUICK REVIEW

[論文レビュー] AlphaStar Unplugged: Large-Scale Offline Reinforcement Learning

Michaël Mathieu, Sherjil Ozair|arXiv (Cornell University)|Aug 7, 2023
Artificial Intelligence in Games被引用数 5
ひとこと要約

本論文は、100万本を超える人間がプレイしたStarCraft IIの対局データを用いた大規模なオフライン強化学習ベンチマーク、AlphaStar Unpluggedを紹介する。1ステップのオフラインRL手法(まず行動方策と価値関数を学習し、その後価値関数を用いて方策を改善する)は、以前のAlphaStar行動クラッシングエージェントに対して90%の勝率を達成し、この複雑で高次元の環境において、標準的なオフラインRLアプローチを上回った。

ABSTRACT

StarCraft II is one of the most challenging simulated reinforcement learning environments; it is partially observable, stochastic, multi-agent, and mastering StarCraft II requires strategic planning over long time horizons with real-time low-level execution. It also has an active professional competitive scene. StarCraft II is uniquely suited for advancing offline RL algorithms, both because of its challenging nature and because Blizzard has released a massive dataset of millions of StarCraft II games played by human players. This paper leverages that and establishes a benchmark, called AlphaStar Unplugged, introducing unprecedented challenges for offline reinforcement learning. We define a dataset (a subset of Blizzard's release), tools standardizing an API for machine learning methods, and an evaluation protocol. We also present baseline agents, including behavior cloning, offline variants of actor-critic and MuZero. We improve the state of the art of agents using only offline data, and we achieve 90% win rate against previously published AlphaStar behavior cloning agent.

研究の動機と目的

  • StarCraft IIの実際の人間プレイデータを用いて、挑戦的で大規模なオフライン強化学習ベンチマークを構築すること。
  • 長期間にわたる計画が必要で報酬が疎らな、部分的に観測可能なマルチエージェント環境におけるオフラインRLアルゴリズムの性能を評価すること。
  • 高次元で現実に近いデータにおいて、帰属条件付き行動クラッシングやQ関数に基づくアプローチといった既存のオフラインRL手法の限界を特定すること。
  • 2段階のオフラインRLレシピの開発と検証:まず行動方策と価値関数を学習し、その後価値関数を用いて方策を改善すること。
  • オンライン環境との相互作用を不要にすることで、StarCraft IIのRL研究への広範なアクセスを可能にし、計算リソースの要件を低減すること。

提案手法

  • BlizzardのBattle.net上で公開された人間プレイヤーによる100万本を超えるStarCraft IIリプレイデータセットを、公式リリースのサブセットとして収集した。
  • 一貫したベンチマーク評価を可能にするために、APIと評価プロトコルを標準化した。
  • 2段階のトレーニングレシピを提案:まずオフラインデータから行動方策と行動価値関数を事前学習し、その後トレーニング中または推論時に価値関数を用いて方策を改善する。
  • 環境との相互作用なしに固定データセットから学習可能な、1ステップのオフラインRLアプローチ(行動クラッシング、オフラインアクタクリティック、MuZeroの変種など)を採用した。
  • 価値関数をクライアント信号として用い、反復的なオフポリシー更新や複雑な価値関数補正の必要性を回避した。
  • 自己自己帰属的行動空間の関数引数にのみ作用するQ関数を実装し、完全な自己自己帰属的行動分布のモデリングにおける課題を回避した。
Figure 1 : Histogram of player MMR from replays used for training.
Figure 1 : Histogram of player MMR from replays used for training.

実験結果

リサーチクエスチョン

  • RQ1帰属条件付き行動クラッシングやQ関数に基づく手法といった標準的なオフラインRLアルゴリズムは、StarCraft IIのような大規模で高次元的かつ部分的に観測可能な環境に、効果的に一般化できるか?
  • RQ2エキスパートや合成的軌道ではなく、弱い人間プレイヤーからのデータにのみトレーニングされた場合、オフラインRL手法はどの程度の性能を示すか?
  • RQ3方策改善が事前に学習した価値関数によって導かれる1ステップのオフラインRL手法は、複雑な環境において、より複雑な反復的オフラインRLアルゴリズムを上回ることができるか?
  • RQ4行動方策と価値関数の学習の組み合わせは、長期間にわたる計画と疎い報酬を持つタスクにおいて、どの程度の強力な性能を発揮できるか?
  • RQ5標準的手法が失敗する状況において、大規模なオフラインRLで成功をもたらす主なアーキテクチャ的およびトレーニング設計上の選択肢は何か?

主な発見

  • 帰属条件付き行動クラッシングやQ関数に基づく手法といった標準的なオフラインRL手法は、最も弱い相手に対しても1ゲームも勝利できず、このベンチマークにおいて一般化能力が著しく低いことが示された。
  • テストされたすべての標準的なオフラインRL手法が、単純な無条件行動クラッシングベースラインを下回った。これは、現実に近い多様な人間データにおいて、既存のアプローチの限界を浮き彫りにした。
  • まず行動方策と価値関数を学習し、その後価値関数を用いて方策を改善する1ステップのオフラインRL手法が、以前に発表されたAlphaStar行動クラッシングエージェントに対して90%の勝率を達成した。
  • 最も優れた性能を示したエージェントの成功は、常に事前に学習した行動価値関数を用いて方策改善を導くことと強く関連しており、これが効果的なオフライン学習において中心的な役割を果たしていることを示唆している。
  • ベンチマークから、小規模なオフラインRLベンチマークで最先端のアルゴリズムが、大規模で現実に近い環境には一般化しないことが明らかになった。これは、新しいアルゴリズム設計の必要性を示唆している。
  • オフラインデータを用いてオンライン環境との相互作用を排除することで、計算リソースの要件を顕著に低減でき、大規模なStarCraft II RL研究をより広範な研究コミュニティが利用可能にした。
Figure 2 : Training procedure.
Figure 2 : Training procedure.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。