Skip to main content
QUICK REVIEW

[논문 리뷰] StarCraft II Build Order Optimization using Deep Reinforcement Learning and Monte-Carlo Tree Search

Islam Elnabarawy, Kristijana Arroyo|arXiv (Cornell University)|2020. 06. 12.
Artificial Intelligence in Games참고 문헌 7인용 수 4
한 줄 요약

이 논문은 스타크래프트 II의 'BuildMarines' 미니게임에서 빌드 오더를 최적화하기 위해 몬테카를로 트리 서치(MCTS)와 딥 강화학습을 융합한 하이브리드 접근법을 제안한다. MCTS 에이전트는 최소한의 계산 자원으로 초보자 수준의 성능을 달성하며, 딥 네트워크의 통합은 시간 제약 내에서 더 깊은 탐색을 가능하게 하고 롤아웃 비용을 줄여 전문가 수준의 결과를 달성하는 데 필수적임을 입증한다.

ABSTRACT

The real-time strategy game of StarCraft II has been posed as a challenge for reinforcement learning by Google's DeepMind. This study examines the use of an agent based on the Monte-Carlo Tree Search algorithm for optimizing the build order in StarCraft II, and discusses how its performance can be improved even further by combining it with a deep reinforcement learning neural network. The experimental results accomplished using Monte-Carlo Tree Search achieves a score similar to a novice human player by only using very limited time and computational resources, which paves the way to achieving scores comparable to those of a human expert by combining it with the use of deep reinforcement learning.

연구 동기 및 목표

  • 스타크래프트 II에서 빌드 오더 최적화를 위해 몬테카를로 트리 서치(MCTS)의 타당성을 조사하기 위해.
  • 맥로 전략 학습을 위한 단순화된 환경인 'BuildMarines' 미니게임에서 MCTS의 고립된 성능을 평가하기 위해.
  • 계산 자원 제약로 인해 순수 MCTS가 전문가 수준의 성능을 달성하는 데 한계가 있음을 규명하기 위해.
  • MCTS와 딥 강화학습을 융합하여 최적화 효율성과 결과 품질을 크게 향상시키기 위한 기반을 마련하기 위해.

제안 방법

  • 에이전트는 시간에 따라 공급 창고, 병영, 마린을 생산하는 데 소요되는 시간과 같은 핵심 게임 변수를 기반으로 한 추상화된 상태 표현을 사용한다.
  • UCB1 선택 전략을 사용한 MCTS 적용 시 탐색 파rameter β = 1/√2로 설정한다.
  • 행동로는 no-op, 노동자 훈련, 공급 창고 건설, 병영 건설, 마린 훈련이 있으며, 행동 선택에 따라 상태 전이가 갱신된다.
  • 생산 큐 시간은 매 프레임마다 진행되며, 광물 수확은 노동자 수에 비례하는 비율로 시뮬레이션된다.
  • 게임은 약 10분 후 종료되며, 최종 점수는 종료 시 생존한 마린 수이다.
  • MCTS 에이전트는 각 시간 단위당 다수의 반복을 수행하며, 반복 수 제한(1~10)에 따라 다양한 결과를 수집한다.

실험 결과

연구 질문

  • RQ1순수 MCTS로도 스타크래프트 II의 'BuildMarines' 미니게임에서 경쟁 가능한 빌드 오더 최적화를 달성할 수 있는가?
  • RQ2MCTS 반복 수를 늘릴수록 최종 마린 수 측면에서 성능에 어떤 영향을 미치는가?
  • RQ3이 환경에서 순수 MCTS의 성능 상한선는 무엇이며, 초보자 및 전문가 수준의 인간 플레이어와 비교해보면 어떠한가?
  • RQ4딥 강화학습 네트워크가 비용이 많이 드는 롤아웃을 가치 함수 추정으로 대체함으로써 MCTS 성능을 얼마나 향상시킬 수 있는가?

주요 결과

  • MCTS 에이전트는 5회의 반복으로 최고 점수 94마리를 기록했으며, 이는 초보자 수준의 인간 플레이어와 유사한 성능이다.
  • 반복 수가 3에서 10 사이일 경우 점수는 약 90~94마리 수준에서 정체되며, 반복 수 증가에 따른 수익 감소를 보인다.
  • 시험 범위 내에서 94마리 이상의 점수 향상은 유의미하게 이루어지지 않아 순수 MCTS의 계산 자원 제약가 명백히 드러난다.
  • 100마리 이상의 점수를 달성하기 위해서는 계산 시간을 크게 증가시켜야 하며, 이는 순수 MCTS가 전문가 수준의 성능을 달성하는 데 부적절함을 시사한다.
  • 연구 결과는 딥 강화학습 네트워크를 통합하여 롤아웃 비용을 줄이고, 고정된 시간 제약 내에서 더 깊고 효율적인 탐색을 가능하게 해야 한다고 결론 내린다.
  • MCTS와 딥 강화학습의 융합은 전문가 수준의 인간 플레이어와 유사한 성능 수준에 도달할 수 있도록 기대할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.