Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Based Reinforcement Learning For Games

Uddeshya Upadhyay, Nikunj Shah|arXiv (Cornell University)|2019. 12. 09.
Artificial Intelligence in Games참고 문헌 16인용 수 10
한 줄 요약

이 논문은 비디오 게임 AI를 위한 Transformer 기반 강화학습 모델(DTQN)을 제안하며, 순환 네트워크 대신 자기주의 메커니즘을 사용하여 순차적 게임 상태를 처리한다. 자연어 처리 분야에서 뛰어난 성능를 보이지만, DTQN은 CartPole 환경에서 LSTM 기반 DRQN보다 성능이 열 劣하며, 이는 RNN이 상태 입력이 희박하고 표 형태인 강화학습 과제에서 시간적 의존성을 더 잘 포착함을 시사한다.

ABSTRACT

Recent times have witnessed sharp improvements in reinforcement learning tasks using deep reinforcement learning techniques like Deep Q Networks, Policy Gradients, Actor Critic methods which are based on deep learning based models and back-propagation of gradients to train such models. An active area of research in reinforcement learning is about training agents to play complex video games, which so far has been something accomplished only by human intelligence. Some state of the art performances in video game playing using deep reinforcement learning are obtained by processing the sequence of frames from video games, passing them through a convolutional network to obtain features and then using recurrent neural networks to figure out the action leading to optimal rewards. The recurrent neural network will learn to extract the meaningful signal out of the sequence of such features. In this work, we propose a method utilizing a transformer network which have recently replaced RNNs in Natural Language Processing (NLP), and perform experiments to compare with existing methods.

연구 동기 및 목표

  • 원래 자연어 처리를 위해 설계된 Transformer 아키텍처가 비디오 게임을 위한 딥 강화학습에 적용 가능한지 탐색한다.
  • 표준 DQN이 장기적 의존성을 다루는 데에 한계가 있음을 해결하기 위해 순환 네트워크를 자기주의 메커니즘으로 대체한다.
  • Transformer의 자기주의 메커니즘이 부분적으로 관찰 가능한 환경에서 순차적 상태 전이를 효과적으로 모델링할 수 있는지 평가한다.
  • DQN, DRQN(LSTM 기반), DTQN(Transformer 기반) 에이전트가 CartPole 제어 과제에서 어떻게 성능을 내는지 비교한다.

제안 방법

  • 제안된 DTQN 모델은 Transformer의 인코더 컴포넌트만 사용하여 CartPole 환경의 상태 임베딩(위치 및 막대 기울기)의 순서를 처리한다.
  • 멀티헤드 자기주의는 입력 순서의 맥락적 표현을 계산하여 다양한 시간 단계의 중요도를 가중치로 평가한다.
  • Transformer 인코더의 출력은 표준 DQN 프레임워크에 따라 행동에 대한 Q-값을 예측하는 데 사용된다.
  • 경험 재생과 타겟 네트워크를 사용하여 엔드 투 엔드로 모델을 훈련시킨다. 이는 DQN 및 DRQN와 동일하다.
  • 실험은 OpenAI Gym의 CartPole 환경에서 수행되며, 입력으로 순수한 상태 값(위치 및 각도)만 사용된다.
  • DQN, DRQN, DTQN 간의 공정한 비교를 위해 하이퍼파rameter는 동일하게 유지된다.

실험 결과

연구 질문

  • RQ1Transformer 기반 아키텍처가 게임 플레이 에이전트의 딥 강화학습에서 순환 네트워크를 효과적으로 대체할 수 있는가?
  • RQ2Transformer의 자기주의 메커니즘이 강화학습에서 순차적 의존성을 모델링할 때 RNN보다 성능상의 이점을 제공하는가?
  • RQ3부분적으로 관찰 가능한 제어 과제인 CartPole에서 Transformer 기반 에이전트(DTQN)의 성능이 DQN 및 DRQN와 어떻게 비교되는가?
  • RQ4Transformer에서 명시적 순환 구조가 없는 것이 순차적 의사결정 과제에서 장기적인 시간적 의존성을 학습하는 데에 약점으로 작용하는가?
  • RQ5랜덤 초기화가 Transformer 기반 강화학습 에이전트의 훈련 안정성과 최종 성능에 크게 영향을 미치는가?

주요 결과

  • 시간적 의존성을 모델링하는 데 LSTM를 사용하는 DRQN이 가장 높은 평균 점수를 기록했으며, 한 번의 실행에서 최대 135 에피소드를 달성했다.
  • DTQN은 DQN 및 DRQN보다 평균적으로 성능이 열 劣하여, Transformer 기반 접근법이 이 순차적 제어 과제에 잘 일반화되지 않았음을 시사한다.
  • DQN과 DTQN은 여러 랜덤 초기화에서 일관성 없는 성능를 보였으며, 훈련 중에 점수가 자주 감소하거나 진동했다.
  • DTQN의 실패는 RNN가 시간 단계를 넘어 은닉 상태를 유지하는 것과는 달리, 시간 진전을 명시적으로 모델링할 수 없다는 데 기인한다.
  • Transformer가 자연어 처리 분야에서 성공을 거둔 것과는 달리, 이 연구에서는 상태 입력이 희박하고 저차원일 경우 RNN이 Transformer보다 성능이 뛰어나다.
  • 순차적 동역학을 강하게 모델링 需하는 과제에서는, 상태 입력이 저차원이고 순차적일 경우 RNN이 자기주의 메커니즘보다 여전히 더 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.