Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Play General Video-Games via an Object Embedding Network

William Woof, Ke Chen|arXiv (Cornell University)|Mar 14, 2018
Reinforcement Learning in Robotics参考文献 18被引用数 3
ひとこと要約

本論文では、ビデオゲームの可変長オブジェクト特徴ベクトルを固定長の統一表現に圧縮するオブジェクト埋め込みネットワーク(OEN)を提案する。これにより、深層強化学習(DRL)エージェントが構造化されたゲーム状態オブジェクトから直接学習できるようになる。5つのGVG-AIゲームで評価した結果、OENベースのエージェントは、生のピクセル入力を使用する最先端のDRLエージェントと同等の性能を達成した。これは、一般のビデオゲームAIにおけるオブジェクトベース表現の有効性を示している。

ABSTRACT

Deep reinforcement learning (DRL) has proven to be an effective tool for creating general video-game AI. However most current DRL video-game agents learn end-to-end from the video-output of the game, which is superfluous for many applications and creates a number of additional problems. More importantly, directly working on pixel-based raw video data is substantially distinct from what a human player does.In this paper, we present a novel method which enables DRL agents to learn directly from object information. This is obtained via use of an object embedding network (OEN) that compresses a set of object feature vectors of different lengths into a single fixed-length unified feature vector representing the current game-state and fulfills the DRL simultaneously. We evaluate our OEN-based DRL agent by comparing to several state-of-the-art approaches on a selection of games from the GVG-AI Competition. Experimental results suggest that our object-based DRL agent yields performance comparable to that of those approaches used in our comparative study.

研究の動機と目的

  • ビデオゲームの生のピクセル入力に依存するエンドツーエンドの深層強化学習(DRL)エージェントの限界を解決すること。
  • ピクセルベースの表現に内在する、高い計算コスト、一般化性能の低さ、解釈不能性といった問題を克服すること。
  • 人間のゲーム理解に近い、意味的に明確なゲーム内オブジェクトデータからDRLエージェントが学習できるようにすること。
  • 異なる属性を持つ可変数のオブジェクトから成る動的ゲーム状態を、統一的かつ固定長の表現にすること。
  • オブジェクトベースのDRLが、多様なビデオゲームにおいて、ピクセルベースの最先端エージェントと同等の性能を達成できることを示すこと。

提案手法

  • ゲームエンジンへのアクセスまたは動画のセマンティックセグメンテーションを用いて、ゲーム状態からオブジェクトレベルの特徴(例:位置、速度、種別)を抽出する。
  • オブジェクトのクラスと属性を含む固定長の特徴ベクトルとして各オブジェクトを表現し、オブジェクトタイプ間で一貫性を保つ。
  • 可変サイズのオブジェクトベクトル集合を処理し、単一の固定長埋め込みベクトルを出力するセットベースのニューラルネットワークアーキテクチャ(OEN)を用いる。
  • エージェントの方策がOENで埋め込まれたゲーム状態に条件付けられるように、DRLアルゴリズム(例:DQNやRainbow)を用いてOENをエンドツーエンドで訓練する。
  • オブジェクトの順序不変性を処理し、関係的文脈を捉えるために、OENにアテンション機構または順列同値性層を適用する。
  • ゲームスコアからのスパarsな報酬を用いて、OENと方策を強化学習により同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトベース表現で学習したDRLエージェントは、生のピクセルデータで学習したエージェントを上回るか、同等の性能を発揮できるか?
  • RQ2学習可能なオブジェクト埋め込みネットワーク(OEN)は、可変長かつ異種のオブジェクト集合を固定長のゲーム状態表現に効果的に圧縮できるか?
  • RQ3オブジェクトベース表現は、ピクセルベースのDRLに比べて訓練時間を短縮し、サンプル効率を向上させるか?
  • RQ4OENベースのエージェントの性能は、ゲームの種類やゲーム状態の複雑さの違いによってどのように変化するか?
  • RQ5再トレーニングやアーキテクチャの変更なしに、オブジェクトベースDRLは複数のゲーム間でどれほど一般化できるか?

主な発見

  • OENベースのDRLエージェントは、テストされた5つのGVG-AIコンペティションゲームすべてで正常にプレイを学習し、多様なゲームメカニクスにわたる頑健性を示した。
  • 5つのゲームすべてにおいて、OENエージェントの性能は、ピクセルベースのDRLエージェントおよび手作業で特徴を設計したベースラインと同等であった。
  • 一部のゲームでは手作業で特徴を設計したベースラインがOENエージェントを上回った。これは、特定のゲームに特化した特徴が依然として極めて有効である可能性を示唆している。
  • わずか200万ステップ(約800万フレーム)の訓練でも、OENエージェントは安定した学習曲線と複数回の実行にわたる一貫性のある性能を達成した。
  • OENモデルは可変長のオブジェクト入力を固定長の表現に効果的に圧縮し、標準的なDRLアーキテクチャとの互換性を実現した。
  • 動的オブジェクト数の変化や複雑な相互作用を伴うゲームに対しても、本手法は有望な対応を示し、より洗練されたゲーム環境へのスケーラビリティを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。