Skip to main content
QUICK REVIEW

[논문 리뷰] Keep CALM and Explore: Language Models for Action Generation in Text-based Games

Shunyu Yao, Rohan Rao|arXiv (Cornell University)|2020. 10. 06.
Topic Modeling참고 문헌 24인용 수 8
한 줄 요약

이 논문은 인간의 플레이 기록 데이터를 기반으로 훈련된 문맥 기반 동작 언어 모델(CALM)을 소개한다. CALM은 텍스트 기반 게임에서 작고 의미적으로 관련성이 높은 동작 후보 집합을 생성한다. CALM을 강화학습 에이전트(DRRN)와 조합함으로써, 이전 최고 성능 모델 대비 제리코 벤치마크에서 평균 점수 69% 향상되었으며, 일부 게임에서는 지식 기반 동작 집합에 접근할 수 있는 모델들조차도 뛰어넘었다.

ABSTRACT

Text-based games present a unique challenge for autonomous agents to operate in natural language and handle enormous action spaces. In this paper, we propose the Contextual Action Language Model (CALM) to generate a compact set of action candidates at each game state. Our key insight is to train language models on human gameplay, where people demonstrate linguistic priors and a general game sense for promising actions conditioned on game history. We combine CALM with a reinforcement learning agent which re-ranks the generated action candidates to maximize in-game rewards. We evaluate our approach using the Jericho benchmark, on games unseen by CALM during training. Our method obtains a 69% relative improvement in average game score over the previous state-of-the-art model. Surprisingly, on half of these games, CALM is competitive with or better than other models that have access to ground truth admissible actions. Code and data are available at https://github.com/princeton-nlp/calm-textgame.

연구 동기 및 목표

  • 텍스트 기반 게임에서 동작 공간의 조합적 크기가 너무 커지며, 그 중 일부 동작만 유효한 상황을 해결하기 위해.
  • 수동으로 만든 규칙나 기저 진리 동작 집합에 의존하지 않고 언어적 사전 지식과 인간의 게임 감각을 동작 생성에 통합하기 위해.
  • 문맥 인식 언어 모델을 사용해 동작 공간을 필터링함으로써 강화학습 에이전트의 샘플 효율성과 성능을 향상시키기 위해.
  • 단일 CALM 모델이 다양한 새로운 텍스트 기반 게임에 일반화될 수 있음을 입증하기 위해.

제안 방법

  • 590개의 다른 텍스트 기반 게임에서 수집한 426개의 인간 플레이 기록 데이터를 기반으로 언어 모델(n-그램 또는 GPT-2)을 훈련하여 문맥 기반 동작 생성 능력을 습득한다.
  • 훈련된 CALM을 사용해 현재 관측 결과와 게임 이력에 따라 각 게임 상태에서 상위-K 동작 후보 목록을 생성한다.
  • 생성된 동작을 예측된 Q-값과 게임 내 보상 기반으로 재순서 정렬하는 딥 강화학습 관련성 네트워크(DRRN)와 CALM을 통합한다.
  • CALM은 인간 데이터 기반 사전 훈련 후 고정하고, DRRN은 게임 보상 데이터를 사용해 엔드 투 엔드로 훈련한다.
  • 모델을 미세조정 없이도 여러 게임에 동일한 CALM 인스턴스를 배포함으로써 평가 게임에 대해 제로샷 일반화를 보장한다.
  • 제리코 벤치마크에서 동작 품질을 평가하기 위해 고립된 생성(기저 진리 유효 동작과 대비)과 종단 간 강화학습 성능을 모두 사용한다.

실험 결과

연구 질문

  • RQ1인간 플레이 기록 데이터를 기반으로 훈련된 언어 모델이 다양한 텍스트 기반 게임에서 의미적으로 관련성 있고 유효한 동작 후보를 생성할 수 있는가?
  • RQ2문맥 기반 언어 모델을 강화학습 에이전트와 조합했을 때, 기저 진리 동작 집합에 접근할 수 없는 이전 방법들보다 성능 향상이 이루어지는가?
  • RQ3단일 CALM 모델이 미세조정 없이도 새로운 텍스트 기반 게임에 얼마나 잘 일반화되는가?
  • RQ4어떤 상황에서는 기저 진리 유효 동작에 접근할 수 있는 모델들보다 CALM이 생성한 동작 후보가 더 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • CALM + DRRN 방법은 제리코 벤치마크에서 이전 최고 성능 모델 대비 평균 정규화 점수 69% 향상되었다.
  • 28개 평가 게임 중 8개에서 CALM은 기저 진리 유효 동작에 접근할 수 있는 모델들보다 뛰어난 성능을 보였으며, 특히 'inhumane' 게임에서 25.7점의 점수를 기록해 이전 최고 성능 모델의 3점보다 높았다.
  • GPT-2 기반 CALM은 n-그램 기반 베이스라인 대비 더 의미적으로 일관되고 문맥에 부합하는 동작을 생성했으며, 물체 상호작용과 일반 지식 기반 동작 예시에서 명백히 향상된 품질을 보였다.
  • 고립된 상황에서 CALM(GPT-2)은 기저 진리 유효 동작과 매우 높은 일치도를 보이며 강력한 언어적 및 게임 감각 사전 지식을 확보하고 있음을 입증했다.
  • 단일 CALM 모델이 다양한 게임 환경에 효과적으로 일반화되었으며, 모든 28개의 평가 게임에 대해 게임 특화 조정 없이 배포되었다.
  • 이 방법은 인간 플레이 데이터를 통해 언어적 및 전략적 사전 지식을 효율적으로 압축된 재사용 가능한 동작 생성 메커니즘으로 변환할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.