Skip to main content
QUICK REVIEW

[논문 리뷰] Procedural Level Generation Improves Generality of Deep Reinforcement Learning

Niels Justesen, Rubén Rodríguez Torrado|arXiv (Cornell University)|2018. 06. 28.
Reinforcement Learning in Robotics인용 수 17
한 줄 요약

이 논문은 비디오 게임에서 강화학습 에이전트의 일반화 능력을 향상시키기 위해 훈련 중에 절차적 레벨 생성(PLG)을 사용하는 것을 제안한다. 다양한 동적 생성 레벨에서 훈련함으로써, 이 접근법은 특히 적응형 난이도 스케일링과 결합되었을 때 새로운 레벨에 대해 성능을 향상시키며, 생성기 분포 분석을 통해 인간 수준의 유사성은 생성기 설계에 크게 의존한다는 점을 밝혀냈다.

ABSTRACT

Deep reinforcement learning (RL) has shown impressive results in a variety of domains, learning directly from high-dimensional sensory streams. However, when neural networks are trained in a fixed environment, such as a single level in a video game, they will usually overfit and fail to generalize to new levels. When RL models overfit, even slight modifications to the environment can result in poor agent performance. This paper explores how procedurally generated levels during training can increase generality. We show that for some games procedural level generation enables generalization to new levels within the same distribution. Additionally, it is possible to achieve better performance with less data by manipulating the difficulty of the levels in response to the performance of the agent. The generality of the learned behaviors is also evaluated on a set of human-designed levels. The results suggest that the ability to generalize to human-designed levels highly depends on the design of the level generators. We apply dimensionality reduction and clustering techniques to visualize the generators' distributions of levels and analyze to what degree they can produce levels similar to those designed by a human.

연구 동기 및 목표

  • 고정된 게임 레벨에서 훈련된 딥 강화학습 에이전트의 과적합 문제를 해결하여 새로운 환경으로의 일반화 능력을 제한하는 것.
  • 훈련 중 절차적 레벨 생성이 동일 분포 내 새로운 레벨로의 일반화 능력을 향상시키는지 조사하는 것.
  • 훈련된 에이전트의 인간이 설계한 레벨에서의 전이 성능를 평가하고, 생성기 설계가 이 일반화에 미치는 역할을 이해하는 것.
  • 차원 감소와 군집 분석을 사용해 생성된 레벨의 분포를 분석하여 인간이 설계한 레벨과의 유사성을 평가하는 것.

제안 방법

  • 고정된 정적 레벨이 아닌 절차적으로 생성된 레벨에서 딥 강화학습 에이전트를 훈련시켜 내성적 강건성과 일반화 능력을 향상시키는 것.
  • 에이전트 성능에 따라 레벨 생성을 조정하는 적응형 난이도 스케줄링을 구현하여 데이터 효율성과 학습 속도를 최적화하는 것.
  • 잠재 공간의 시각화와 다양성 및 커버리지 평가를 위해 차원 감소 기법(예: 오토인코더 또는 t-SNE)을 적용하는 것.
  • 군집 기반 기법을 사용해 생성된 레벨의 분포를 분석하고 인간이 설계한 레벨 군집과 비교하는 것.
  • 훈련된 에이전트를 절차적으로 생성된 레벨과 인간이 설계한 테스트 레벨 모두에서 평가하여 제로샷 일반화 성능를 측정하는 것.
  • 구조적 및 기계적 복잡도가 다른 정도로 다양한 수준의 생성기를 설계하여 그 일반화에 미치는 영향를 평가하는 것.

실험 결과

연구 질문

  • RQ1훈련 중 절차적 레벨 생성이 동일 게임 분포 내 새로운, 미리 보지 않은 레벨로의 딥 강화학습 에이전트의 일반화 능력을 향상시키는가?
  • RQ2PLG 중 적응형 난이도 스케줄링이 RL 에이전트의 데이터 효율성과 최종 성능에 어떤 영향을 미치는가?
  • RQ3절차적으로 생성된 레벨에서 훈련된 에이전트가 인간이 설계한 레벨으로 일반화하는 정도는 어느 정도이며, 이는 레벨 생성기의 설계에 따라 어떻게 달라지는가?
  • RQ4군집 분석과 차원 감소를 통해 측정했을 때, 절차적으로 생성된 레벨의 분포는 인간이 설계한 레벨의 분포와 얼마나 유사한가?

주요 결과

  • 고정된 레벨에서 훈련된 에이전트에 비해 절차적 레벨 생성을 통해 훈련된 에이전트는 동일 분포 내 새로운 레벨로의 일반화 능력이 뚜렷이 향상된다.
  • 훈련 중 적응형 난이도 스케줄링은 최적의 난이도 수준을 유지함으로써 데이터 요구량을 줄이고 최종 성능을 향상시킨다.
  • 인간이 설계한 레벨로의 일반화 능력은 생성기 설계에 크게 의존하며, 일부 생성기는 다른 생성기보다 인간이 만든 콘텐츠에 더 가까운 레벨을 생성한다.
  • 차원 감소와 군집 분석을 통해 일부 생성기만이 인간이 설계한 레벨과 구조적·기계적으로 유사한 레벨 분포를 생성한다는 점이 밝혀졌다.
  • 연구는 생성기 설계가 인간이 만든 콘텐츠로 지식을 전이하는 데에 에이전트의 능력에 직접적인 영향을 미친다는 점을 규명하며, 일반화의 핵심적 저해요소를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.