Skip to main content
QUICK REVIEW

[論文レビュー] Training artificial neural networks to learn a nondeterministic game

Thomas E. Portegys|arXiv (Cornell University)|Jul 14, 2015
Machine Learning and Algorithms参考文献 11被引用数 4
ひとこと要約

この論文は、部分的状態観測による不確実性を模倣するPongを用いて、人工ニューラルネットワーク(ANNs)が非決定的ゲーム環境を学習する方法を調査している。Mona、Elman、NuPICの3つのモデルが評価され、NuPICは不確実性を扱う能力に優れており、不完全な情報下でも確率的ダイナミクスを学習できることが示された。

ABSTRACT

It is well known that artificial neural networks (ANNs) can learn deterministic automata. Learning nondeterministic automata is another matter. This is important because much of the world is nondeterministic, taking the form of unpredictable or probabilistic events that must be acted upon. If ANNs are to engage such phenomena, then they must be able to learn how to deal with nondeterminism. In this project the game of Pong poses a nondeterministic environment. The learner is given an incomplete view of the game state and underlying deterministic physics, resulting in a nondeterministic game. Three models were trained and tested on the game: Mona, Elman, and Numenta's NuPIC.

研究の動機と目的

  • 人工ニューラルネットワークが、状態情報が不完全なために確率的であるとされる非決定的環境をどのようにナビゲートできるかを調査すること。
  • 異なる再帰的ニューラルネットワークアーキテクチャが、内在的な不確実性を有するゲームを学習する際の性能を評価すること。
  • 人工ニューラルネットワークが部分的観測下で一般化し、効果的な意思決定が行えるかどうかを評価すること。これは、現実世界の予測不能なシステムを模倣するものである。
  • 制御されたゲーム環境において、確率的ダイナミクスに適応・学習するのに最も効果的なニューラルアーキテクチャを特定すること。

提案手法

  • ゲームPongを変更し、エージェントがゲーム状態の部分的視認しか得られず、隠れたボールおよびパドルの位置により非決定的になるようにした。
  • 時間的誤差逆伝播法を用いて、Mona、Elman、NuPICの3つの再帰的ニューラルネットワークモデルを、生のゲーム観測から方策を学習するように訓練した。
  • 報酬がスパarsely与えられる強化学習を用い、ゲームスコアに基づいてボールの接触を維持するよう促した。
  • モデルは順次的なゲームフレームを処理し、隠れた状態ダイナミクスを推定し、最適なパドル移動を予測した。
  • 評価は、学習曲線、最終的パフォーマンス、複数回の訓練実行における状態不確実性への耐性に焦点を当てた。
  • パフォーマンスは、同一の部分的観測条件下でのテストエピソードにおける平均スコアと一貫性で測定された。

実験結果

リサーチクエスチョン

  • RQ1人工ニューラルネットワークは、部分的状態観測に起因する非決定的結果を持つゲームを学習できるか?
  • RQ2異なる再帰的ネットワークアーキテクチャは、不確実性下でのロバストな方策を学習する際にどのように比較されるか?
  • RQ3重要な情報が欠落している状況下で、ANNはどれほど隠れたゲーム状態を推定し、効果的な意思決定が行えるか?
  • RQ4ネットワークアーキテクチャの選択が、確率的環境下での学習安定性およびパフォーマンスに顕著に影響を与えるか?
  • RQ5部分的観測下で訓練されたANNは、未観測のゲーム状態に対しても十分に一般化できるか?

主な発見

  • NuPICは、学習効率および最終的パフォーマンスにおいてMonaおよびElmanを上回り、部分的観測下でも高い平均スコアを達成した。
  • Elmanネットワークは中程度の学習能力を示したが、訓練実行間でパフォーマンスのばらつきが大きかった。
  • Monaは最も遅い収束を示し、最終的なパフォーマンスも最低であったことから、不確実性を処理する能力に制限があることが示された。
  • すべてのモデルが時間の経過とともに向上したが、唯一NuPICだけが複数のテストエピソードにわたり一貫して高いパフォーマンスを維持した。
  • 結果から、十分な時間的文脈が与えられた場合、再帰的ネットワークが非決定的ダイナミクスを学習できることが確認された。
  • 本研究は、神経ネットワークが動的かつ確率的環境において欠落した状態情報を効果的に補完できる可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。