Skip to main content
QUICK REVIEW

[論文レビュー] DeepCrawl: Deep Reinforcement Learning for Turn-based Strategy Games

Alessandro Sestini, Alexander Kuhnle|arXiv (Cornell University)|Dec 3, 2020
Reinforcement Learning in Robotics参考文献 14被引用数 5
ひとこと要約

本論文では、深層強化学習(DRL)ポリシー・ネットワークを用いて非プレイヤー・キャラクタ(NPC)を制御するターン・バイ・ターンのローグライクゲームのプロトタイプ、DeepCrawlを提示する。これらのNPCは、プロキシマル・ポリシー最適化(PPO)を用いて訓練された。手動で設計された戦略が不要な状態で、信頼性があり、クリア可能な、多様なNPC行動を効果的に生成した。DRLがモバイルおよびデスクトップゲームにおける魅力的で、超人間的でないAI相手を設計する実用的ツールとして機能できることを示している。

ABSTRACT

In this paper we introduce DeepCrawl, a fully-playable Roguelike prototype for iOS and Android in which all agents are controlled by policy networks trained using Deep Reinforcement Learning (DRL). Our aim is to understand whether recent advances in DRL can be used to develop convincing behavioral models for non-player characters in videogames. We begin with an analysis of requirements that such an AI system should satisfy in order to be practically applicable in video game development, and identify the elements of the DRL model used in the DeepCrawl prototype. The successes and limitations of DeepCrawl are documented through a series of playability tests performed on the final game. We believe that the techniques we propose offer insight into innovative new avenues for the development of behaviors for non-player characters in video games, as they offer the potential to overcome critical issues with

研究の動機と目的

  • 深層強化学習(DRL)が、ビデオゲームにおける魅力的で、超人間的でないNPC行動を生成する実用的ゲームデザインツールとして使用可能かどうかを調査すること。
  • iOSおよびAndroidのようなモバイルプラットフォームに適した、パラメータチューニングにより多様なNPCタイプをサポートする、軽量でデプロイ可能なDRLフレームワークを開発すること。
  • NPCの難易度をバランスさせ、挑戦的ではあるがクリア可能であるようにすることで、楽しさと現実性のあるゲームプレイ体験を保証すること。
  • DRLが、手動で設計されたAIルールや事前の行動仕様なしに、多様で戦略的行動を生成できるかどうかを評価すること。

提案手法

  • ゲームは、手続き的に生成されるダンジョンレベルを備えたターン・バイ・ターンのローグライク環境を採用しており、各レベルでプレイヤーは複数の敵エージェントと戦う。
  • NPCエージェントは、アクター・クリティック型の深層強化学習アルゴリズムであるプロキシマル・ポリシー最適化(PPO)を用いて訓練されたポリシー・ネットワークによって制御される。
  • ポリシーおよび価値ネットワークは、共通の畳み込みニューラルネットワークアーキテクチャを共有しており、入力特徴量にはエージェントのステータス、環境状態、および行動空間が含まれる。
  • 訓練の加速と最終的パフォーマンスの向上を図るために、段階的なタスク複雑度の増加を適用するカリキュラム学習戦略が採用された。
  • スパarsな報酬が使用された:勝利で+10、死亡で-10、ステップ制限に達した場合は0。密度の高い報酬形状や手動で設計された報酬関数は使用されなかった。
  • ハイパーパramータには、ポリシー学習率$10^{-6}$、ベースライン学習率$10^{-4}$、割引率$\gamma = 0.99$、および探索率$\epsilon = 0.2$が含まれる。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習を用いて、超人間的または単純すぎるAIの欠陥を避ける信頼性があり、かつクリア可能なNPCを訓練できるか?
  • RQ2同一のDRLフレームワークが、パrameterの変更のみで、異なるNPCタイプに対して多様で戦略的行動を生成できる程度はどの程度か?
  • RQ3カリキュラム学習は、スパarsな報酬、ターン・バイ・ターンのゲーム環境において、訓練効率と最終的ポリシー品質を顕著に向上させるか?
  • RQ4事前の知識や手動で設計されたルールなしに、DRLがスパarsな報酬に依存して、効果的なNPC行動を生成できるか?

主な発見

  • 訓練におけるカリキュラム学習の使用は、収束を顕著に加速させ、最終パフォーマンスを向上させた。カリキュラムなしでの訓練と比較して、エージェントはより高い平均報酬を達成した。
  • プレイアビリティテストにおけるプレイヤーの評価では、NPCエージェントは知的で戦略的に整合性があり、クラス(例:戦士、射手、レンジャー)に応じて意味的に異なる行動を示しており、成功裏に行動の多様性が実現された。
  • スパarsな報酬にもかかわらず、DRLエージェントは事前の行動仕様なしに効果的な戦略を学習した。これは、モデルが複雑な戦術を自律的に発見できる能力を示している。
  • 10名のプレイテスト参加者の全員が、注意と時間の投資を要するが、ゲームを楽しみ、クリア可能であると評価した。これにより、エージェントは挑戦的ではあるが、超人間的ではなく、バランスの取れたゲームプレイが実現されたことが裏付けられた。
  • エージェントの行動は、他のローグライクゲームのものと同等またはそれ以上の水準であり、テスト参加者からは、敵の戦術の多様性により再プレイ価値が高いと指摘された。
  • DRLフレームワークはモバイルプラットフォームでもデプロイ可能であり、軽量なネットワークアーキテクチャのおかげで、モバイルデバイス上での効率的な推論が可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。