Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Fictitious Self-Play on ELF Mini-RTS

Keigo Kawamura, Yoshimasa Tsuruoka|arXiv (Cornell University)|2019. 02. 06.
Reinforcement Learning in Robotics참고 문헌 20인용 수 5
한 줄 요약

이 논문은 ELF 플랫폼 상의 Mini-RTS에 신경망 허구적 자기대립(NFSP)를 적용하여, 정책 기반 강화학습과 NFSP를 융합해 더 잘 공격을 피할 수 있고 게임이론적으로 안정된 전략을 도출한다. 원시 자기대립으로 NFSP 에이전트를 미리 훈련시키면 스케일러비리티와 수렴 속도가 크게 향상되어, 자기대립에서 이론적 수렴 보장이 없음에도 불구하고 강력하고 안정된 전략을 도출할 수 있다.

ABSTRACT

Despite the notable successes in video games such as Atari 2600, current AI is yet to defeat human champions in the domain of real-time strategy (RTS) games. One of the reasons is that an RTS game is a multi-agent game, in which single-agent reinforcement learning methods cannot simply be applied because the environment is not a stationary Markov Decision Process. In this paper, we present a first step toward finding a game-theoretic solution to RTS games by applying Neural Fictitious Self-Play (NFSP), a game-theoretic approach for finding Nash equilibria, to Mini-RTS, a small but nontrivial RTS game provided on the ELF platform. More specifically, we show that NFSP can be effectively combined with policy gradient reinforcement learning and be applied to Mini-RTS. Experimental results also show that the scalability of NFSP can be substantially improved by pretraining the models with simple self-play using policy gradients, which by itself gives a strong strategy despite its lack of theoretical guarantee of convergence.

연구 동기 및 목표

  • 다중 에이전트 환경에서의 비정적 특성 문제를 해결하면서 실시간 전략(RTS) 게임에 대해 게임이론적 해법을 개발하기 위해 NFSP를 적용한다.
  • ELF 플랫폼 상의 비트레이드, 불완전 정보를 가진 RTS 게임인 Mini-RTS에 NFSP를 적용하여 나시 균형에 가까운 전략 프로파일을 계산한다.
  • 정책 기반 강화학습을 사용해 원시 자기대립을 통해 NFSP의 강화학습 구성 요소를 사전 훈련시킴으로써 NFSP의 스케일러비리티와 훈련 효율성을 향상시킨다.
  • 빠르지만 불안정한 자기대립을 사용해 사전 훈련하면, 복잡한 RTS 환경에서 NFSP의 성능과 안정성 향상 여부를 평가한다.

제안 방법

  • NFSP는 Mini-RTS에 대해 이중 플레이어, 제로섬, 불완전 정보를 가진 광범위한 형태의 게임으로 적용된다.
  • NFSP 에이전트는 강화학습(RL) 헤드(최적 반응 정책용)와 지도학습(SL) 헤드(전략 평균화용)를 갖는 이중 헤드 신경망을 사용한다.
  • RL 구성 요소는 상대의 평균 전략에 대한 최적 반응을 계산하기 위해 근접 정책 최적화(PPO)를 사용한다.
  • SL 구성 요소는 과거 전략의 재생 버퍼를 유지하고 가중 평균을 계산하여 메타전략을 형성한다.
  • 사전 훈련은 먼저 PPO를 사용해 원시 자기대립으로 RL 헤드를 훈련한 후, 동일한 정책 파ram을 SL 헤드에 초기화함으로써 수행된다.
  • 이 사전 훈련 과정은 PPO의 빠른 학습 능력을 활용하면서도 NFSP의 이론적 수렴 보장을 유지함으로써 더 빠른 수렴과 더 나은 안정성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1NFSP를 정책 기반 강화학습과 효과적으로 융합하여 Mini-RTS에서 안정적이고 잘 공격을 피할 수 있는 전략을 도출할 수 있는가?
  • RQ2PPO를 사용해 원시 자기대립으로 NFSP 에이전트를 사전 훈련하면, 그 스케일러비리티와 수렴 속도에 어떤 영향을 미치는가?
  • RQ3원시 자기대립에서 이론적 수렴 보장이 없음에도 불구하고, 사전 훈련이 NFSP의 성능을 초기 훈련과 비교해 향상시키는가?
  • RQ4사전 훈련 전략은 AI-Simple 및 AI-Hit-and-Run과 같은 강력한 베이스라인 AI에 대해 최종 에이전트의 성능을 유지하거나 향상시킬 수 있는가?
  • RQ5사전 훈련은 NFSP의 느린 수렴 문제를 어느 정도 완화하면서도 게임이론적 안정성을 유지하는가?

주요 결과

  • PPO를 사용해 원시 자기대립으로 NFSP 에이전트를 사전 훈련하면, NFSP를 초기 상태에서 훈련하는 것과 비교해 학습 과정이 크게 가속화되고 스케일러비리티가 향상된다.
  • 사전 훈련 방법은 기준 자기대립 전략이 略로 약간 약해져도 성능이 높은 수준에서 안정적으로 유지되는 전략을 도출한다.
  • 사전 훈련된 NFSP 에이전트는 사전 훈련되지 않은 NFSP를 초월하여 더 안정적이고 잘 공격을 피할 수 있는 전략 프로파일을 달성한다.
  • 사전 훈련 방법은 PPO의 빠른 학습 능력을 효과적으로 활용하면서도 NFSP의 수렴 보장을 유지하여 강력하고 확장 가능한 훈련 파이프라인을 제공한다.
  • 실험 결과는 사전 훈련 방법이 계산 시간을 줄이고, 자기대립 알고리즘이 진동하더라도 효과가 있다는 것을 보여주며, 복잡한 게임 환경에서 실용적 이점을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.