Skip to main content
QUICK REVIEW

[論文レビュー] CCPT: Automatic Gameplay Testing and Validation with Curiosity-Conditioned Proximal Trajectories

Alessandro Sestini, Linus Gisslén|arXiv (Cornell University)|Feb 21, 2022
Artificial Intelligence in Games被引用数 5
ひとこと要約

本稿では、複雑な3Dナビゲーション環境におけるゲームプレイバグやデザイン上の見落としを自動で検出するため、好奇心駆動型探索と模倣学習を組み合わせた深層強化学習手法CCPTを提案する。エキスパートのデモに近い状態で探索を促す探索条件付き内発的報酬を用いてエージェントを訓練することで、優れたカバレッジを達成し、疑わしいまたは破損したトラジェクトリを特定する。これにより、ゲームデザイナーは最小限の人的介入で問題を自動的に強調表示し、分析できる。

ABSTRACT

This paper proposes a novel deep reinforcement learning algorithm to perform automatic analysis and detection of gameplay issues in complex 3D navigation environments. The Curiosity-Conditioned Proximal Trajectories (CCPT) method combines curiosity and imitation learning to train agents to methodically explore in the proximity of known trajectories derived from expert demonstrations. We show how CCPT can explore complex environments, discover gameplay issues and design oversights in the process, and recognize and highlight them directly to game designers. We further demonstrate the effectiveness of the algorithm in a novel 3D navigation environment which reflects the complexity of modern AAA video games. Our results show a higher level of coverage and bug discovery than baselines methods, and it hence can provide a valuable tool for game designers to identify issues in game design automatically.

研究の動機と目的

  • 複雑なAAAゲームにおける手動プレイテストの課題に対処すること。これは規模と複雑さのため、時間のかかる上に不完全になりがちである。
  • ゲーム環境を体系的に探索し、欠落したコリジョンボックスやバグなどのゲームプレイ上の問題を検出できる自動化された手法を開発すること。
  • ゲームデザイナーが人間のテスト担当者やランダムな探索に頼らず、問題のあるトラジェクトリを特定・強調表示できるようにすること。
  • 内発的好奇心とエキスパートのデモを組み合わせ、既知の良いパスに近い意味のある的を絞った探索をエージェントに導くこと。
  • ベースラインの探索および模倣学習手法を凌駕するスケーラブルで再利用可能な自動ゲームプレイテストフレームワークを構築すること。

提案手法

  • CCPTは、模倣学習と好奇心に基づく内発的報酬を統合したハイブリッド強化学習フレームワークを採用し、エージェントの行動をガイドする。
  • この手法は、エージェントがエキスパートのデモに近接しながらも、新規状態を探索するよう促す、探索に依存する内発的報酬関数を用いる。
  • 環境の構造を符号化するために3次元セマンティック占有マップが使用され、エージェントのグローバルな位置を表すための位置埋め込みも併用される。
  • 方策ネットワークは、観測を3次元畳み込みアーキテクチャを介して処理し、セマンティックおよび空間的情報に基づいて意思決定を行う。
  • 評価段階では、トレーニング時に使用した同じ好奇心モジュールが、期待と大きく逸脱する行動を示すトラジェクトリをフィルタリング・強調表示する。
  • このアプローチは、ナビゲーションをガイドするだけでなく、的を絞ったテストの対象領域を定義するためにエキスパートのデモを活用する。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、エキスパートの軌道に近接しながらも、複雑な3Dゲーム環境を効果的に探索し、デザイン上の見落としを検出できるか?
  • RQ2好奇心と模倣学習を組み合わせることで、純粋な好奇心または純粋な模倣学習と比較して、探索カバレッジとバグ検出性能がどのように向上するか?
  • RQ3位置埋め込みとセマンティック占有マップの併用は、ナビゲーションにおける異常検出能力の一般化をどの程度向上させるか?
  • RQ4内発的好奇心モジュールを用いて、疑わしいまたは破損したゲームプレイトラジェクトリを自動でフィルタリング・強調表示できるか?
  • RQ5以前にテストされていなかった領域に対して、繰り返しCCPTを適用することで、新たな問題を発見する際のスケーラビリティはどの程度向上するか?

主な発見

  • CCPTは、純粋な模倣学習および純粋な好奇心ベースの探索と比較して、マップカバレッジの面で優れている。より多様で広範な経路を発見している。
  • CCPTで訓練されたエージェントは、エキスパートのデモに従いつつも高いカバレッジを達成しており、逸脱の正確な局所化が可能である。
  • アブレーションスタディの結果、正規化された値や学習された埋め込みと比較して、位置埋め込みの使用が性能を顕著に向上させている。
  • 3次元セマンティック占有マップと3次元畳み込みネットワークの組み合わせは、レイトキャスティングベースラインやグローバルのみの表現を上回る性能を示している。
  • 好奇心モジュールは、欠落したコリジョンボックスや意図しない行動といった、潜在的なゲームプレイ問題を効果的に特定・強調表示している。
  • 事前に特定された問題のあるトラジェクトリを新たなデモとして用いてCCPTを繰り返し適用することで、モードコラプスを緩和し、以前に未検査だった問題領域へのカバレッジを拡大できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。