Skip to main content
QUICK REVIEW

[論文レビュー] Towards Interactive Training of Non-Player Characters in Video Games

Igor Borovikov, Jesse Harder|arXiv (Cornell University)|Jun 3, 2019
Digital Games and Media参考文献 16被引用数 13
ひとこと要約

本論文では、人間によるフィードバックを組み込んだインタラクティブな模倣学習フレームワークを提案し、ビデオゲーム内の非プレイヤーNPC(NPC)の訓練を実現する。アクション履歴を含む拡張状態を備えたマルチリゾリューションのアンサンブル・マルコフモデルを採用することで、最小限の人的介入で高精度なNPC行動を達成し、1分未満のインタラクティブな訓練で、gym環境およびファーストパーソンショーター・ゲームの両方で効果的なスキル習得が実証された。

ABSTRACT

There is a high demand for high-quality Non-Player Characters (NPCs) in video games. Hand-crafting their behavior is a labor intensive and error prone engineering process with limited controls exposed to the game designers. We propose to create such NPC behaviors interactively by training an agent in the target environment using imitation learning with a human in the loop. While traditional behavior cloning may fall short of achieving the desired performance, we show that interactivity can substantially improve it with a modest amount of human efforts. The model we train is a multi-resolution ensemble of Markov models, which can be used as is or can be further "compressed" into a more compact model for inference on consumer devices. We illustrate our approach on an example in OpenAI Gym, where a human can help to quickly train an agent with only a handful of interactive demonstrations. We also outline our experiments with NPC training for a first-person shooter game currently in development.

研究の動機と目的

  • ビデオゲームにおける手作業で設計されたNPC行動のスケーラビリティと現実性の限界を解決すること。
  • ゲームデザイナーが最小限の干渉で、人間らしく自然なNPCをインタラクティブなデモンストレーションにより訓練できることを可能にすること。
  • アクション履歴と量子化された状態表現を組み込むことで、模倣学習における一般化性能とスタイルの忠実度を向上させること。
  • コンsumerハードウェアに適合する軽量でリアルタイム対応のモデルを開発すること。
  • 複雑なオープンワールドゲーム環境におけるインタラクティブな訓練の可能性を実証すること。

提案手法

  • 本手法は、人間のデモンストレーションに基づいて学習されたマルチリゾリューションのマルコフモデルのアンサンブルを用い、階層的かつスタイルに特化した行動を捉える。
  • 現在の観測値と直近のアクション履歴(最大nステップ)を組み合わせることで、拡張状態を構築し、人間らしいスタイルを保つ能力を向上させる。
  • 状態空間とアクション空間の量子化により、限られたデモンストレーションからの一般化が可能となり、モデルの複雑さが低減され、推論速度が向上する。
  • モデルは反復的に訓練され、デザイナーがエージェントの失敗時に制御を一時的に引き取る人間によるフィードバック制御を組み込む。
  • 本フレームワークは、DAGGERやブートストラップベースのデータ生成によるモデル圧縮をサポートし、リアルタイムゲーム環境へのデプロイを可能にする。
  • ゲーム状態の特徴量は、相対的な意味を持つ表現(例:相対的位置、視界、ヒットポイント、弾薬数)に変換され、学習効率が向上する。

実験結果

リサーチクエスチョン

  • RQ1標準的な行動クラーニングと比較して、インタラクティブで人間によるフィードバックを組み込んだ模倣学習は、NPC行動の質を顕著に向上させるか?
  • RQ2アクション履歴を含む拡張状態の使用は、人間プレイのスタイル的要素をどれほど効果的に保持できるか?
  • RQ3量子化されたマルチリゾリューションのマルコフモデルは、少数のインタラクティブなデモンストレーションからどれほど一般化できるか?
  • RQ4本手法は、複雑なオープンワールドのファーストパーソンショーター・ゲームで、実行可能でリアルタイム対応のNPCを訓練できるか?
  • RQ5モデルの性能は、インタラクティブなデモンストレーション数の増加や、異なる量子化スキームの変更に伴ってどのようにスケーリングするか?

主な発見

  • Lunar Lander環境において、数回のインタラクティブなデモンストレーション後、ランダムエージェントよりも著しく高い性能を達成し、少なくとも1つのエピソードが完全に解決された。
  • マルコフアンサンブルモデルは、人間とのインタラクション40秒以内にファーストパーソンショーター・ゲームで攻撃的行動を学習し、ハードコードされたフォールバックロジックの必要性を排除した。
  • モデルの推論効率は高く維持され、デモンストレーション数に比例してロード時間と推論時間が線形に増加し、リアルタイム利用が可能であった。
  • 状態空間とアクション空間の量子化により、限られた訓練データでも効果的な一般化が可能となり、未観測状態に対しても耐性が向上した。
  • 本手法は、たとえ人間のデモンストレーションが最適でない場合でも、ランダムポリシーを著しく上回ることを実証した。特に、インタラクティブな是正が組み込まれた場合に顕著であった。
  • DAGGERや合成データ生成によるモデル圧縮が可能であり、コンsumr級ハードウェアに搭載可能なコンパクトで高性能なモデルのデプロイが実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。