Skip to main content
QUICK REVIEW

[論文レビュー] On Multi-Agent Learning in Team Sports Games

Yunqi Zhao, Igor Borovikov|arXiv (Cornell University)|Jun 25, 2019
Reinforcement Learning in Robotics参考文献 57被引用数 12
ひとこと要約

本論文は、チームスポーツビデオゲームにおける人間らしい高難易度のエージェントを訓練するための階層的強化学習アプローチを提案する。低レベル行動には模倣学習を、高レベル戦略には深層強化学習(PPO/DQN)を組み合わせる。結果として、PPOは2対2の試合でDQNをわずかに上回り(55:45)、DQNに比べ10倍速く収束した。一方、Rainbowは不相性なハイパーパrameterのため失敗した。

ABSTRACT

In recent years, reinforcement learning has been successful in solving video games from Atari to Star Craft II. However, the end-to-end model-free reinforcement learning (RL) is not sample efficient and requires a significant amount of computational resources to achieve superhuman level performance. Model-free RL is also unlikely to produce human-like agents for playtesting and gameplaying AI in the development cycle of complex video games. In this paper, we present a hierarchical approach to training agents with the goal of achieving human-like style and high skill level in team sports games. While this is still work in progress, our preliminary results show that the presented approach holds promise for solving the posed multi-agent learning problem.

研究の動機と目的

  • 人間らしい振る舞いを示し、高難易度のプレーが可能なエージェントを開発すること。
  • エンドツーエンドのモデルフリー強化学習が人間らしい行動を生成できないことや、データ収集効率の低さといった制限を克服すること。
  • 低レベル行動は模倣学習で、高レベル戦略は強化学習で学習する階層的学習のアプローチを検討すること。
  • 訓練済みポリシーの未確認環境における一般化性とロバスト性を評価すること。
  • マルチエージェントチームスポーツ環境における報酬の形状付けと信用配分の最適化を調査すること。

提案手法

  • 中レベルシミュレータ(STS2)を用いて、低レベル行動(模倣学習)と高レベル戦略(深層強化学習)を分離する階層的フレームワークを構築する。
  • 深層Qネットワーク(DQN)とプロキシマルポリシーオプティマイゼーション(PPO)を用いて、スパarsな報酬と形状付けられた報酬の両方でエージェントを訓練する。
  • 報酬の形状付けには、得点に+1、失点に-1、ボール支配の獲得に+0.8、失うと-0.8を設定する。
  • 共有ポリシーを用いた集中型トレーニングを検討したが、上位レベルのプランナが存在しないと有用な行動を学習できなかった。
  • STS2シミュレータを用いて、本格的なゲーム環境への展開前にポリシーの訓練と評価を実施する。
  • 将来の統合を想定し、トランスファーラーニングおよび集中型トレーニング手法(QMIX、集中型クリティック)を検討した。

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習アプローチは、チームスポーツゲームにおいて人間らしい振る舞いと高難易度のプレーを併せ持つエージェントを生成できるか?
  • RQ2スパース報酬下でマルチエージェント戦略を訓練する際、PPOはDQNに比べてどの程度効果的か?
  • RQ3他の分野では成功を収めたにもかかわらず、なぜRainbowはこの環境では失敗したのか?
  • RQ4従来のAI相手に対して訓練されたポリシーは、新しい相手に対してどの程度一般化できるか?
  • RQ5マルチエージェント強化学習におけるチームスポーツの文脈で、信用配分とチームワークをどのように改善できるか?

主な発見

  • PPOは人間の経験換算で約6か月で収束したが、DQNは約5年を要した。これは、トレーニング効率が10倍向上したことを示している。
  • PPOチームはDQNチームに対して直接対戦で55:45で勝利し、より優れた一般化性能とポリシーのロバスト性を示した。
  • DQNエージェントは、従来のAI相手と対戦した際、50%の得点率を達成しており、訓練環境内での中程度の成功を示した。
  • Rainbowエージェントはすべての実験で失敗した。これは、分布型強化学習や優先順位付き経験再生に不適切なハイパーパrameterが原因であると推測される。
  • 1つのポリシーで2エージェントを集中型でトレーニングしたが、有用な行動を学習できなかった。これは、上位レベルのプランナの存在が不可欠であることを示唆している。
  • 適切な報酬の形状付けにより、エージェントは攻撃的・守備的役割を明確に学習し、チームワークとボール支配の制御が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。