Skip to main content
QUICK REVIEW

[論文レビュー] Skynet: A Top Deep RL Agent in the Inaugural Pommerman Team Competition

Chao Gao, Pablo Hernández-Leal|arXiv (Cornell University)|Apr 20, 2019
Reinforcement Learning in Robotics参考文献 10被引用数 15
ひとこと要約

本論文では、初回のPommermanチームコンペティションにおいて2位を達成した上位の性能を示す深層強化学習エージェントであるSkynet955を提示する。エージェントは、特に自殺的爆弾配置を含む危険な行動を削除するための新規なActionFilterモジュールを採用しており、これによりより効率的な探索と学習が可能になった。加えてPPOベースの学習、報酬形状化、自己対戦相手を用いたカリキュラム学習が実装されている。

ABSTRACT

The Pommerman Team Environment is a recently proposed benchmark which involves a multi-agent domain with challenges such as partial observability, decentralized execution (without communication), and very sparse and delayed rewards. The inaugural Pommerman Team Competition held at NeurIPS 2018 hosted 25 participants who submitted a team of 2 agents. Our submission nn_team_skynet955_skynet955 won 2nd place of the "learning agents'' category. Our team is composed of 2 neural networks trained with state of the art deep reinforcement learning algorithms and makes use of concepts like reward shaping, curriculum learning, and an automatic reasoning module for action pruning. Here, we describe these elements and additionally we present a collection of open-sourced agents that can be used for training and testing in the Pommerman environment. Code available at: https://github.com/BorealisAI/pommerman-baseline

研究の動機と目的

  • 部分的に観測可能な、報酬が疎であるPommerman環境において、分散実行可能な強力なマルチエージェント深層強化学習エージェントの開発を目的とする。
  • マルチエージェント環境における遅延報酬、誤った責任割り当て、部分的観測の課題に対処することを目的とする。
  • 行動フィルタリング機構による事前知識の統合を通じて、サンプル効率と学習安定性を向上させることを目的とする。
  • カリキュラム学習と多様な訓練相手を用いることで、さまざまな相手タイプに一般化できるようにすることを目的とする。
  • Pommerman環境におけるベンチマークと訓練のためのオープンソースエージェントスイートをリリースすることを目的とする。

提案手法

  • 深層強化学習のためのProximal Policy Optimization (PPO)で訓練されたニューラルネットワーク方策を採用した。
  • 手動で作成されたルールを用いて、不正および自殺的行動(例:自滅を引き起こす爆弾の配置)を削除するActionFilterモジュールを実装した。
  • 最初に弱い相手(例:SmartRandomNoBomb)に対して学習し、次第に強い相手へと進めるカリキュラム学習を用いた。
  • 安全で戦略的な行動(自傷を避ける、敵の排除を優先するなど)を促進するために報酬形状化を適用した。
  • エージェントは壁の崩壊がないV0環境でのみ訓練したが、コンペティションのV1バージョン(壁の動的崩壊あり)で評価した。
  • 訓練および評価用として、StaticAgent、SmartRandom、SmartRandomNoBomb、CautiousAgentのエージェントのコレクションをオープンソース化した。

実験結果

リサーチクエスチョン

  • RQ1ルールベースのフィルタリングによる行動の削除は、報酬が疎で部分的に観測可能なマルチエージェント環境において、サンプル効率と学習安定性をどのように向上させるか?
  • RQ2相手タイプにわたるカリキュラム学習は、Pommermanチーム設定において一般化能力と最終的パフォーマンスをどの程度向上させるか?
  • RQ3壁の崩壊がない簡素化された環境(V0)で訓練された深層強化学習エージェントは、壁の崩壊があるより複雑なバージョン(V1)に効果的に一般化できるか?
  • RQ4事前知識(例:自殺を避ける)の統合は、自己対戦訓練における戦略的行動の出現にどのように影響するか?
  • RQ5相手の多様性は、訓練済み方策の過適合を防ぎ、強靭性を向上させるうえで果たす役割は何か?

主な発見

  • Skynet955エージェントは、NeurIPS 2018 Pommermanチームコンペティションの「学習エージェント」カテゴリで2位を達成した。
  • ActionFilterモジュールにより行動空間が縮小され、自殺的かつ不正な行動が削除されたことで、学習の安定性とサンプル効率が著しく向上した。
  • SimpleAgentのチームに対しては70%の勝率を記録したが、CautiousAgentのチームに対しては約10%の勝率にとどまり、一般化の課題が浮き彫りになった。
  • 最初にSmartRandomNoBombのような弱い相手に対して学習するカリキュラム学習の導入により、最終的なパフォーマンスが向上し、強靭性も向上した。
  • オープンソース化されたエージェント、特にSmartRandomNoBombとCautiousAgentは、RLエージェントの訓練における強力で、悪用されにくい相手として効果を発揮した。
  • V0(壁の崩壊なし)で訓練されたにもかかわらず、V1(壁の崩壊あり)でも妥当なパフォーマンスを示したため、特定の条件下で学習済み方策の転送が可能であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。