Skip to main content
QUICK REVIEW

[논문 리뷰] Training artificial neural networks to learn a nondeterministic game

Thomas E. Portegys|arXiv (Cornell University)|2015. 07. 14.
Machine Learning and Algorithms참고 문헌 11인용 수 4
한 줄 요약

이 논문은 부분적 상태 관찰을 통해 실제 세계의 예측 불가능성을 시뮬레이션하는 Pong을 사용하여 인공 신경망(ANN)이 비결정론적 게임 환경을 학습하는 방법을 조사한다. Mona, Elman, NuPIC 세 가지 모델이 평가되었으며, NuPIC는 불확실성을 다루는 데 뛰어난 성능을 보여, 완전한 정보가 없음에도 불구하고 ANNs가 확률적 역학을 학습할 수 있음을 입증한다.

ABSTRACT

It is well known that artificial neural networks (ANNs) can learn deterministic automata. Learning nondeterministic automata is another matter. This is important because much of the world is nondeterministic, taking the form of unpredictable or probabilistic events that must be acted upon. If ANNs are to engage such phenomena, then they must be able to learn how to deal with nondeterminism. In this project the game of Pong poses a nondeterministic environment. The learner is given an incomplete view of the game state and underlying deterministic physics, resulting in a nondeterministic game. Three models were trained and tested on the game: Mona, Elman, and Numenta's NuPIC.

연구 동기 및 목표

  • 인간의 상태 정보가 불완전하여 결과가 확률적일 때 인공 신경망이 비결정론적 환경을 어떻게 탐색할 수 있는지 조사하는 것.
  • 내재된 불확실성이 존재하는 게임을 학습하는 데 있어 다양한 순환 신경망 아키텍처의 성능을 평가하는 것.
  • 부분적 관찰 조건 하에서 ANNs가 일반화하고 효과적인 결정을 내릴 수 있는 능력을 평가하는 것. 이는 실제 세계의 예측 불가능한 시스템을 모방한다.
  • 통제된 게임 환경에서 확률적 역학에 적응하고 학습하는 데 있어 가장 효과적인 신경망 아키텍처를 규명하는 것.

제안 방법

  • 에이전트가 게임 상태의 부분적 시각만을 받도록 Pong 게임을 수정하여, 숨겨진 공과 패드 위치로 인해 비결정론성이 발생하도록 하였다.
  • 시간적 역전파를 사용하여 원시 게임 관찰에서 정책을 학습하기 위해 순환 신경망 모델인 Mona, Elman, NuPIC을 훈련시켰다.
  • 에이전트가 공을 유지하는 데 성공할 경우에만 희박한 보상을 제공하는 강화학습 기반의 훈련이 이루어졌다.
  • 모델들은 순차적인 게임 프레임을 처리하여 숨겨진 상태 역학을 추론하고 최적의 패드 이동을 예측하였다.
  • 평가에서는 학습 곡선, 최종 성능, 그리고 다수의 훈련 런에 걸친 상태 불확실성에 대한 내구성에 중점을 두었다.
  • 성능는 동일한 부분적 관찰 조건 하에서 테스트 에피소드 동안의 평균 점수와 일관성으로 측정되었다.

실험 결과

연구 질문

  • RQ1부분적 상태 관찰로 인해 비결정론적 결과가 발생하는 게임을 인공 신경망이 학습할 수 있는가?
  • RQ2다양한 순환 네트워크 아키텍처는 불확실성 하에서 강력한 정책을 학습하는 데 어떻게 비교되는가?
  • RQ3핵심 정보가 누락되었을 때 ANNs가 얼마나 잘 숨겨진 게임 상태를 추론하고 효과적인 결정을 내릴 수 있는가?
  • RQ4네트워크 아키텍처의 선택이 확률적 환경에서 학습 안정성과 성능에 상당한 영향을 미치는가?
  • RQ5부분적 관찰 조건 하에서 훈련된 ANNs가 미리 보지 않은 게임 상태로 일반화하는 데 얼마나 잘 성공하는가?

주요 결과

  • NuPIC는 부분적 관찰 조건 하에서 학습 효율성과 최종 성능에서 Mona와 Elman을 모두 압도하여 더 높은 평균 점수를 기록하였다.
  • Elman 네트워크는 중간 정도의 학습 능력을 보였지만, 훈련 런 간 성능 변동성이 높았다.
  • Mona는 가장 느린 수렴 속도와 가장 낮은 최종 성능를 보여, 불확실성을 다루는 데 한계를 보였다.
  • 모든 모델가 시간이 지남에 따라 향상되었지만, 유일하게 NuPIC만이 다수의 테스트 에피소드에서 일관되게 높은 성능를 유지했다.
  • 결과는 순환 신경망이 충분한 시간적 맥락을 기반으로 훈련될 경우 비결정론적 역학을 다룰 수 있음을 확인한다.
  • 이 연구는 신경망이 동적이고 확률적인 환경에서 누락된 상태 정보를 효과적으로 보완할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.