Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Differentiable Procedural Content Generation through Generative Playing Networks

Philip Bontrager, Julian Togelius|arXiv (Cornell University)|2020. 02. 12.
Artificial Intelligence in Games참고 문헌 23인용 수 15
한 줄 요약

이 논문은 기여자-평가자 강화학습 과정을 통해 에이전트와 절차적 콘텐츠 생성기를 동시에 훈련하는 완전히 미분 가능한 프레임워크인 생성형 플레이 네트워크(GPN)를 소개한다. 생성기는 평가자의 피드백에 기반해 레벨을 생성하며, 이는 에이전트 능력에 맞게 도전도를 조정하는 암묵적 커리큘럼을 형성한다. 인간이 설계한 예시나 도메인 지식 없이도 엔드 투 엔드 훈련이 가능하며, 2D 던전 크래일러 환경에서 성능을 입증하였다.

ABSTRACT

To procedurally create interactive content such as environments or game levels, we need agents that can evaluate the content; but to train such agents, we need content they can train on. Generative Playing Networks is a framework that learns agent policies and generates environments in tandem through a symbiotic process. Policies are learned using an actor-critic reinforcement learning algorithm so as to master the environment, and environments are created by a generator network which tries to provide an appropriate level of challenge for the agent. This is accomplished by the generator learning to make content based on estimates by the critic. Thus, this process provides an implicit curriculum for the agent, creating more complex environments over time. Unlike previous approaches to procedural content generation, Generative Playing Networks is end-to-end differentiable and does not require human-designed examples or domain knowledge. We demonstrate the capability of this framework by training an agent and level generator for a 2D dungeon crawler game.

연구 동기 및 목표

  • 절차적 콘텐츠 생성에서 '닭과 계란' 문제를 해결하기 위해, 에이전트는 훈련을 위해 콘텐츠가 필요하고, 콘텐츠는 평가를 위해 에이전트가 필요하다.
  • 절차적 콘텐츠 생성기를 훈련할 때 인간이 설계한 콘텐츠나 도메인 특화 히ュ리스틱에 의존하지 않도록 하기 위해.
  • 에이전트 정책과 콘텐츠 생성기를 동시에 강화학습을 통해 훈련하는 통합적이고 미분 가능한 프레임워크를 개발하기 위해.
  • 에이전트 성능 추정에 기반해 레벨 난이도를 조정함으로써 생성기가 암묵적 커리큘럼을 형성하도록 하기 위해.

제안 방법

  • 에이전트(액터)는 레벨을 탐색하는 방식으로 학습하고 평가자(크리틱)는 그 성능을 평가하는 액터-크리틱 강화학습 설정을 사용한다.
  • 생성망은 평가자의 가치 추정치를 기반으로 레벨을 생성하며, 이를 복잡성 조절 신호로 사용한다.
  • 훈련은 엔드 투 엔드로 미분 가능하여 평가자의 평가 결과에서 생성기와 에이전트로 기울기(gradient)가 흐르도록 한다.
  • 에이전트의 현재 정책 성능에 기반해 과제가 어려우나 해결 가능한 레벨을 생성하도록 학습한다.
  • 더 나은 에이전트가 더 복잡한 레벨을 만들어내고, 더 나은 레벨이 에이전트 정책을 향상시키는 피드백 루프가 형성된다.
  • 인간이 설계한 예시나 수작업으로 만든 규칙을 사용하지 않으며, 에이전트-환경 상호작용 루프를 통한 완전 자율 훈련이다.

실험 결과

연구 질문

  • RQ1완전히 미분 가능한 프레임워크가 인간이 설계한 예시 없이 에이전트와 절차적 콘텐츠 생성기를 동시에 훈련할 수 있는가?
  • RQ2생성기는 어떻게 에이전트 성능에 기반해 암묵적 커리큘럼을 형성하는 콘텐츠를 학습할 수 있는가?
  • RQ3평가자 피드백이 점차 어려워지지만 해결 가능한 레벨을 생성하도록 얼마나 효과적으로 이끌 수 있는가?
  • RQ4엔드 투 엔드의 미분 가능성은 에이전트와 콘텐츠 생성기의 안정적이고 효과적인 훈련을 가능하게 하는가?
  • RQ5상호보완적 훈련 과정은 기존의 지도 학습 또는 히ュ리스틱 기반 절차적 콘텐츠 생성 방식과 비교해 어떻게 다를 수 있는가?

주요 결과

  • 프레임워크는 인간이 설계한 콘텐츠 없이도 에이전트 정책과 레벨 생성기를 완전히 미분 가능하고 엔드 투 엔드 방식으로 성공적으로 훈련시켰다.
  • 생성기는 에이전트의 현재 성능에 따라 난이도가 조정되는 레벨을 학습하여 암묵적 커리큘럼을 형성했다.
  • 평가자의 가치 추정치가 생성기를 효과적으로 이끌어, 에이전트의 변화하는 숙련 수준에 맞는 콘텐츠를 생성하도록 유도했다.
  • 기울기 기반 최적화를 통해 안정적인 훈련을 달성했으며, 수작업으로 만든 규칙이나 보상 형상화에 의존하지 않았다.
  • 2D 던전 크래일러 환경에서의 실험을 통해 에이전트가 점차 복잡한 레벨을 마스터할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.