Skip to main content
QUICK REVIEW

[논문 리뷰] Learn How to Cook a New Recipe in a New House: Using Map Familiarization, Curriculum Learning, and Common Sense to Learn Families of Text-Based Adventure Games

Xusen Yin, Jonathan May|arXiv (Cornell University)|2019. 08. 13.
Artificial Intelligence in Games참고 문헌 21인용 수 12
한 줄 요약

이 논문은 공통 주제(예: 요리)를 가진 텍스트 기반 어드벤처 게임의 가족을 학습할 수 있도록 지ap 편집 및 맵 익숙해짐을 통합한 커리큘럼 학습 접근법을 제안한다. 인간과 유사한 학습 방식—간단한 것에서 시작하고, 먼저 환경 탐색을 하며 불확실한 행동을 우선시함—을 통해, 동일 주제 가족에 属하는 새로운 게임에서 기존 기준보다 훨씬 높은 성공률를 달성한다.

ABSTRACT

We consider the task of learning to play families of text-based computer adventure games, i.e., fully textual environments with a common theme (e.g. cooking) and goal (e.g. prepare a meal from a recipe) but with different specifics; new instances of such games are relatively straightforward for humans to master after a brief exposure to the genre but have been curiously difficult for computer agents to learn. We find that the deep Q-learning strategies that have been successfully leveraged for superhuman performance in single-instance action video games can be applied to learn families of text video games when adopting simple strategies that correlate with human-like learning behavior. Specifically, we build agents that learn to tackle simple scenarios before more complex ones using curriculum learning, that familiarize themselves in an unfamiliar environment by navigating before acting, and that explore uncertain environments more thoroughly using contextual multi-armed bandit decision policies. We demonstrate improved task completion rates over reasonable baselines when evaluating on never-before-seen games of that theme.

연구 동기 및 목표

  • 공통 주제를 가졌지만 특정 사항이 다른 텍스트 기반 어드벤처 게임의 가족 간 일반화 문제를 해결하기 위해.
  • 단일 인스턴스 성능을 넘어서 강화 학습 에이전트의 샘플 효율성과 일반화 능력을 향상시키기 위해.
  • 진행적 기술 습득과 행동 이전의 환경 탐색과 같은 인간과 유사한 학습 행동을 모방하기 위해.
  • 광범위한 사전 훈련에 의존하는 것을 줄이기 위해 일반 지식과 맥락 기반 탐색 전략을 통합하기 위해.

제안 방법

  • 에이전트는 주제 가족 내에서 더 단순한 게임 인스턴스에서 더 복잡한 인스턴스로 진행되는 커리큘럼 학습을 사용한다.
  • 행동을 취하기 전에, 에이전트는 환경을 탐색하여 공간적 인지와 물체 인식을 구축하는 맵 익숙해짐 단계를 수행한다.
  • 맥락 기반 다중 손잡이 밴딧 정책이 불확실성이 높은 행동을 우선시함으로써 탐색 효율성을 향상시킨다.
  • 에이전트는 일반 지식과 환경의 구조를 활용하여 타당한 행동를 추론하고 행동 공간을 줄인다.
  • 딥 Q-러닝을 계층적 탐색 및 계획과 통합하여 장기적 목표 달성 능력을 향상시킨다.
  • 프레임워크는 동일 주제(예: 요리)에서 온 게임 커리큘럼으로 훈련되고, 동일 가족의 unseen 게임에서 평가된다.

실험 결과

연구 질문

  • RQ1커리큘럼 학습이 주제 가족 내에서 텍스트 기반 어드벤처 게임의 제로샷 일반화를 향상시킬 수 있는가?
  • RQ2행동 이전의 맵 익숙해짐이 샘플 효율성과 성공률에 어떤 영향을 미치는가?
  • RQ3맥락 기반 다중 손잡이 밴딧이 부분 관측 가능한 텍스트 기반 환경에서 탐색을 얼마나 효과적으로 향상시킬 수 있는가?
  • RQ4일반 지식 추론은 개별 게임 인스턴스에 대한 광범위한 훈련이 필요한지 감소시킬 수 있는가?
  • RQ5이 전략들을 조합하면 표준 딥 Q-러닝 기준 대비 unseen 게임에서 측정 가능한 성능 향상을 이끌 수 있는가?

주요 결과

  • 제안된 방법은 기존 강력한 기준 기반 에이전트에 비해 동일 주제 가족 내 unseen 게임에서 훨씬 높은 작업 완료 비율을 달성한다.
  • 행동 이전의 맵 익숙해짐은 새로운 환경에서 더 빠른 수렴과 더 신뢰할 수 있는 내비게이션을 이끈다.
  • 맥락 기반 다중 손잡이 밴딧은 불확실하거나 정보량이 많은 행동에 집중함으로써 탐색 효율성을 향상시킨다.
  • 커리큘럼 학습 전략은 복잡도와 물체 구성이 다른 게임 인스턴스 간 일반화를 가능하게 한다.
  • 에이전트는 간단한 작업에서 시작하여 점차 복잡한 것을 마스터하는 인간과 유사한 학습 진행을 보인다.
  • 이 프레임워크는 동일 주제의 새로운 게임으로 효과적으로 일반화되며, 인스턴스 간 강력한 전이 학습 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.