Skip to main content
QUICK REVIEW

[논문 리뷰] Using reinforcement learning to learn how to play text-based games

Mikuláš Zelinka|arXiv (Cornell University)|2018. 01. 06.
Artificial Intelligence in Games참고 문헌 1인용 수 10
한 줄 요약

이 논문은 자연어 상태 및 동작 기술을 사용하여 텍스트 기반 게임을 플레이하는 강화학습 에이전트 SSAQN을 제안한다. LSTM과 밀집층을 통해 공유되는 텍스트 표현을 활용함으로써, 다양한 게임 간에 강력한 일반화 및 전이 학습을 달성하였으며, 이는 이전 모델들을 능가하고, 동시에 여러 게임을 동시에 훈련함으로써 성능 향상을 보이며, 특히 복잡한 게임 *Machine of Death*에서 거의 최적의 보상 수준을 달성하였다.

ABSTRACT

The ability to learn optimal control policies in systems where action space is defined by sentences in natural language would allow many interesting real-world applications such as automatic optimisation of dialogue systems. Text-based games with multiple endings and rewards are a promising platform for this task, since their feedback allows us to employ reinforcement learning techniques to jointly learn text representations and control policies. We present a general text game playing agent, testing its generalisation and transfer learning performance and showing its ability to play multiple games at once. We also present pyfiction, an open-source library for universal access to different text games that could, together with our agent that implements its interface, serve as a baseline for future research.

연구 동기 및 목표

  • 자연어 입력을 사용하여 텍스트 기반 게임을 플레이하는 최적의 정책을 학습할 수 있는 일반 목적의 강화학습 에이전트를 개발하는 것.
  • 자연어 상태 및 동작 공간을 갖는 복잡한 순차적 의사결정 과제인 텍스트 기반 게임의 맥락에서 강화학습 에이전트의 일반화 및 전이 학습 능력을 조사하는 것.
  • 다양한 텍스트 게임에 접근할 수 있는 통합형 오픈소스 인터페이스를 구축하여 이 분야의 표준화된 평가 및 향후 연구를 가능하게 하는 것.
  • 동시 다중 게임 훈련이 개별 게임 훈련에 비해 성능 향상과 지식 전이에 기여하는지 평가하는 것.
  • 다양한 언어적 및 구조적 특성을 가진 다양한 게임 환경 간에 일반화할 수 있는 단일 에이전트 아키텍처의 실현 가능성 평가

제안 방법

  • 에이전트인 SSAQN(공유 구조 액터-크리틱 네트워크)는 단어 임베딩, 문장 인코딩을 위한 LSTM 계층, Q-값 예측을 위한 밀집 계층을 포함한 공유 신경망 아키텍처를 사용한다.
  • 훈련을 안정화하기 위해 경험 재생 및 타겟 네트워크 업데이트를 활용한 딥 Q-네트워크(DQN) 원리를 적용한다.
  • 에이전트는 상태 기술과 동작 기술을 모두 토큰 시퀀스로 처리하며, 공유 임베딩과 공동 상호작용 함수를 사용해 Q-값을 계산한다.
  • 손실 함수는 예측된 Q-값과 타겟 Q-값 간의 시간 차수 오차를 기반으로 하며, RMSProp을 사용한 확률적 경사 하강법으로 최적화된다.
  • 훈련 중 탐색과 이용의 균형을 확보하기 위해 감소하는 에psilon-그리디 탐색 전략을 사용한다.
  • pyfiction 라이브러리는 다양한 텍스트 게임에 접근하고 시뮬레이션할 수 있는 유니버설 인터페이스로, 여러 환경 간 표준화된 평가를 가능하게 한다.

실험 결과

연구 질문

  • RQ1다양한 언어적 및 구조적 특성을 지닌 다양한 텍스트 기반 게임 간에 단일 강화학습 에이전트가 일반화할 수 있는가?
  • RQ2다양한 게임을 동시에 훈련하는 것이 개별 게임 훈련에 비해 성능 향상과 지식 전이에 기여하는가?
  • RQ3에이전트가 볼 수 없는 게임으로의 일반화를 지원하는 게임 상태 및 동작의 이전 가능한 표현을 얼마나 잘 학습할 수 있는가?
  • RQ4보상 최적화 및 수렴 속도 측면에서 이전 연구 대비 에이전트의 성능은 어떻게 비교되는가?
  • RQ5에이전트는 *Machine of Death*와 같은 복잡하고 비결정적인 게임에서 거의 인간 수준의 성능을 달성할 수 있는가?

주요 결과

  • *Machine of Death* 게임에서 SSAQN 에이전트는 거의 최적의 평균 보상 16.0을 기록하여 이전 연구에서 보고된 숙련된 인간 플레이어의 성능을 초월하였다.
  • 특히 비결정적인 *Machine of Death* 게임에서 다중 게임 동시 훈련을 통해 성능 향상이 뚜렷하게 나타나 효과적인 지식 전이가 이루어졌음을 시사하였다.
  • 공유 표현을 사용함에도 불구하고, 예측할 수 없는 게임으로의 일반화 능력은 여전히 어려웠으며, 이는 텍스트 기반 게임이 정책 변화에 민감하고, 제로샷 전이가 어렵다는 점을 보여주었다.
  • 해 등(2015)의 연구에서 테스트한 두 게임에서 DRRN 모델과 비교해 성능가 동등하거나 뛰어난 성능을 보이며 그 효과성을 입증하였다.
  • pyfiction 라이브러리는 다양한 텍스트 게임에 대한 유니버설 액세스를 성공적으로 제공하였으며, 향후 텍스트 게임 강화학습 분야의 연구 기준으로 유용하게 활용될 수 있었다.
  • 결과적으로 현재 모델들이 효과적인 정책을 학습할 수는 있지만, 다양한 텍스트 게임 환경 간에 강력한 일반화 및 전이 학습을 달성하는 데는 여전히 큰 도전 과제가 남아 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.