Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Design Games: Strategic Environments in Reinforcement Learning

Haifeng Zhang, Jun Wang|arXiv (Cornell University)|2017. 07. 05.
Reinforcement Learning in Robotics참고 문헌 33인용 수 4
한 줄 요약

이 논문은 환경가 고정되어 있지 않고 에이전트와 함께 학습되고 최적화되는 새로운 강화학습 프레임워크를 제안한다. 이는 전략적인 환경 설계를 가능하게 한다. 이중 마르코프 결정 과정을 정식화하고 정책 기반 강화학습 또는 생성 모델링 프레임워크를 사용함으로써, 에이전트의 약점을 악용하는 어려운, 적응형 미로를 생성하는 방법을 개발한다. 이는 게임 디자인 작업에서 다양한 에이전트 유형에 대해 효과적임을 입증한다.

ABSTRACT

In typical reinforcement learning (RL), the environment is assumed given and the goal of the learning is to identify an optimal policy for the agent taking actions through its interactions with the environment. In this paper, we extend this setting by considering the environment is not given, but controllable and learnable through its interaction with the agent at the same time. This extension is motivated by environment design scenarios in the real-world, including game design, shopping space design and traffic signal design. Theoretically, we find a dual Markov decision process (MDP) w.r.t. the environment to that w.r.t. the agent, and derive a policy gradient solution to optimizing the parametrized environment. Furthermore, discontinuous environments are addressed by a proposed general generative framework. Our experiments on a Maze game design task show the effectiveness of the proposed algorithms in generating diverse and challenging Mazes against various agent settings.

연구 동기 및 목표

  • 표준 강화학습을 확장하여 환경를 고정된 것이 아니라 제어 가능하고 학습 가능한 것으로 간주함으로써.
  • 게임 디자인, 쇼핑 공간 레이아웃, 교통 신호 제어와 같이 환경의 구조가 행동에 영향을 주는 실제 응용 분야를 다루기 위해.
  • 에이전트와 환경 간의 최소 최대 게임으로서의 환경 설계를 모델링함으로써, 환경가 에이전트를 도전적으로 적응시킴으로써.
  • 연속적인 환경 매개변수를 위한 정책 기반 강화학습 방법과 이산적인 환경을 위한 생성 모델링 프레임워크를 개발하기 위해.
  • 미로 생성 작업을 통해 본 방법을 평가하여, 에이전트 행동에 맞게 맞춤형으로 전략적 도전 과제가 되는 다양한 환경을 생성할 수 있음을 보여주기 위해.

제안 방법

  • 에이전트의 MDP를 반영하는 방식으로 환경의 상태 전이를 모델링하기 위해 환경용 이중 MDP를 정의한다.
  • 에이전트의 누적 보상을 최소화하는 데 기여하는 매개변수화된 환경 설계를 최적화하기 위해 정책 기반 강화학습 해법을 유도한다.
  • 이산적인 환경을 다루기 위해 기울기 제약을 우회하는 일반적인 생성 모델링 프레임워크를 제안한다.
  • 에이전트의 학습 동역학을 보상 신호로 사용하여 강화학습을 통해 환경 생성기를 훈련시킨다.
  • 최소 최대 설정에서 환경 생성기를 훈련시킨다: 환경는 에이전트 성능을 낮추는 데 목적이 있으며, 동시에 에이전트는 보상을 최대화하도록 학습한다.
  • 본 방법을 미로 생성에 적용하여, 다양성 있는 에이전트(옵티멀(OPT), DQN, DFS, RHS)를 평가 대상으로 삼아 적응성과 전략적 설계 능력을 시험한다.

실험 결과

연구 질문

  • RQ1강화학습이 고정된 것으로 간주되는 환경가 아니라, 환경의 구조 자체를 학습하고 최적화할 수 있는가?
  • RQ2에이전트의 약점을 악용함으로써 특정 에이전트 행동을 도전적으로 만들 수 있는 전략적 환경을 어떻게 설계할 수 있는가?
  • RQ3학습 기반 프레임워크에서 이산적이거나 미분 불가능한 환경 설계를 효과적으로 최적화할 수 있는 방법은 무엇인가?
  • RQ4환경 생성기는 에이전트의 정책과 학습 동역학에 따라 설계를 어떻게 적응적으로 조정하는가?
  • RQ5제안된 방법이 다양한 에이전트 유형에 걸쳐 다양하고 비트리비얼하며 도전적인 환경을 얼마나 잘 생성할 수 있는가?

주요 결과

  • 최적(OPT) 에이전트와 대결할 때 환경 생성기는 길고 좁은 미로를 성공적으로 설계하여 최적 경로 탐색을 어렵게 하는 경로 길이를 최대화한다.
  • ε-그리디 확률적 정책을 사용하는 DQN 에이전트와 대결할 때 생성기는 탐색을 혼란스럽게 하고 수렴을 지연시키기 위해 많은 분기점을 생성한다.
  • 오른손 법칙에 의존하는 RHS 에이전트를 방해하기 위해 생성기는 높은 대칭성을 가진 미로를 생성한다.
  • DFS 에이전트와 대결할 때 생성기는 단일 입구를 가진 큰 폐쇄 영역을 생성하여 포괄적 탐색을 유도하고 셀 방문 횟수를 두 배로 늘린다.
  • 학습 곡선을 보면 OPT, DFS, RHS 에이전트는 빠른 수렴을 보였지만, DQN 에이전트는 학습 도중 성능 향상으로 인해 곡선이 복잡하게 나타났다.
  • 본 방법은 에이전트의 특정 약점을 효과적으로 악용함으로써, 공동 학습을 통해 환경 설계를 자동화하고 적응형으로 만들 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.