Skip to main content
QUICK REVIEW

[論文レビュー] Experience-Driven PCG via Reinforcement Learning: A Super Mario Bros Study

Tianye Shu, Jialin Liu|ArXiv.org|Jun 30, 2021
Artificial Intelligence in Games被引用数 7
ひとこと要約

本稿では、経験に基づく手続き的コンテンツ生成(EDPCG)と強化学習(PCGRL)を統合した新規フレームワークEDRLを提案する。このフレームワークにより、リアルタイムで無限に続く、遊び応えがあり、遊び可能な『スーパーマリオブラザーズ』のステージを生成可能である。事前に訓練されたGANの潜在ベクトルを用いてステージセグメントを生成し、強化学習(RL)エージェントがそれらを選び、連結することで、KL発散に基づく報酬関数を用いて遊び応えと多様性を最適化する。自動修復とAIベースの遊び可能性テストにより、品質と正しさが保証される。

ABSTRACT

We introduce a procedural content generation (PCG) framework at the intersections of experience-driven PCG and PCG via reinforcement learning, named ED(PCG)RL, EDRL in short. EDRL is able to teach RL designers to generate endless playable levels in an online manner while respecting particular experiences for the player as designed in the form of reward functions. The framework is tested initially in the Super Mario Bros game. In particular, the RL designers of Super Mario Bros generate and concatenate level segments while considering the diversity among the segments. The correctness of the generation is ensured by a neural net-assisted evolutionary level repairer and the playability of the whole level is determined through AI-based testing. Our agents in this EDRL implementation learn to maximise a quantification of Koster's principle of fun by moderating the degree of diversity across level segments. Moreover, we test their ability to design fun levels that are diverse over time and playable. Our proposed framework is capable of generating endless, playable Super Mario Bros levels with varying degrees of fun, deviation from earlier segments, and playability. EDRL can be generalised to any game that is built as a segment-based sequential process and features a built-in compressed representation of its game content.

研究の動機と目的

  • 強化学習を用いたオンラインで経験に基づく手続き的コンテンツ生成(PCG)のフレームワークを開発すること。
  • 特に『スーパーマリオブラザーズ』のような複雑なプラットフォーマーにおいて、リアルタイムで無限に続く、遊び応えがあり、遊び可能なレベルを生成する課題に取り組むこと。
  • 遊び応えと歴史的乖離というプレイヤー経験メトリクスを、強化学習の報酬関数に統合し、パーソナライズされたレベルデザインを実現すること。
  • ニューラルネットワーク支援の進化的な修復とAIベースのテストを用いて、生成されたレベルの遊び可能性と正しさを保証すること。
  • GVGAIベンチマークゲームにとどまらず、大きなアクション空間とセグメントベースのレベル設計を持つゲームへもEDRLフレームワークの汎用性とスケーラビリティを示すこと。

提案手法

  • EDRLフレームワークは、効率的なオンライン処理のため、事前に訓練されたGANを用いてステージセグメントを生成し、その潜在ベクトルを表現する。
  • 強化学習(RL)エージェントがこれらの潜在ベクトルを選択し、連結することで、リアルタイムに長いレベルを構築する。報酬関数により遊び応えと多様性のバランスが保たれる。
  • 報酬関数は、Kosterの遊びの原則を定量化し、連続するステージセグメント間のKullback-Leibler(KL)発散を調整することで、適度な変動を維持する。
  • CNet支援の進化的なアルゴリズムが、破損したチューブなどの構造的欠陥を修正し、正しさを保証する。
  • 遊び可能性は、A*エージェントを用いて、全ステージがクリア可能かどうかをテストすることで検証される。
  • システムはオンラインで動作し、プレイヤー経験メトリクスに応じて動的に適応するリアルタイムのレベル生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1GVGAIフレームワークを超えて、『スーパーマリオブラザーズ』のような複雑なプラットフォーマーにおいて、強化学習を用いて無限に続く、遊び応えがあり、遊び可能なレベルを効果的に生成できるか。
  • RQ2遊び応えや歴史的乖離といったプレイヤー経験メトリクスを、強化学習ベースのレベル生成システムに形式化し、統合する方法は何か。
  • RQ3事前に訓練されたGANからの潜在ベクトルベースの生成が、リアルタイムで高速かつスケーラブルで多様なレベル構成を可能にする程度はどの程度か。
  • RQ4自動修復とAIベースの遊び可能性テストにより、人的介入なしに生成されたレベルの正しさと遊び可能性をどのように保証できるか。
  • RQ5EDRLフレームワークは、圧縮されたコンテンツ表現を持つ、順次的かつセグメントベースのプロセスで構築される他のゲームへも一般化可能か。

主な発見

  • EDRLフレームワークは、リアルタイムで無限に続く、遊び応えがあり、遊び可能な『スーパーマリオブラザーズ』のステージを成功裏に生成した。RLエージェントはKL発散に基づく報酬設計により、遊び応えと多様性のバランスを学習した。
  • RLエージェントはセグメント間で中程度のKL発散を達成しており、過度な予測不可能性を避けるとともに、プレイヤーの関与を維持するための多様性の適切な調整がなされていることが示された。
  • ニューラルネットワーク支援の進化的な修復機構は、生成されたレベルの構造的欠陥を効果的に修正し、正しさが向上し、障害発生率が低下した。
  • A*エージェントによるAIベースのテストにより、すべての生成されたレベルが完全に遊び可能であることが確認され、最終出力が機能的かつ完全であることが保証された。
  • フレームワークはGVGAIゲームにとどまらず、セグメントベースの設計を持つより複雑で大きなアクション空間を持つゲームへのスケーラビリティを示した。
  • テストエージェントの行動に応じて適応する仕組みにより、パーソナライズされたレベル生成が可能であることが示され、プレイヤーのスキルや好みに応じた動的な適応の可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。