Skip to main content
QUICK REVIEW

[논문 리뷰] Combining Strategic Learning and Tactical Search in Real-Time Strategy Games

Nicolas A. Barriga, Marius Stănescu|arXiv (Cornell University)|2017. 09. 11.
Artificial Intelligence in Games참고 문헌 28인용 수 20
한 줄 요약

이 논문은 실시간 전략( RTS ) 게임을 위한 하이브리드 AI 아키텍처를 제안한다. 이 아키텍처는 고수준 전략적 의사결정을 위한 딥 컨volution 뉴럴 네트워크(CNN)와 저수준 전술적 최적화를 위한 몬테카를로 트리 검색(MCTS)을 조합한다. CNN은 퍼펫 서치(Puppet Search)의 출력을 이용해 지도학습으로 훈련되며, 추상적 행동을 선택한다. 나머지 계산 시간은 국소적인 전술적 검색에 사용되며, 이로 인해 56.7%의 승률을 기록하여 개별 구성 요소와 최신 기술 수준의 에이전트를 모두 능가한다. 이는 표준 맵에서의 결과이다.

ABSTRACT

A commonly used technique for managing AI complexity in real-time strategy (RTS) games is to use action and/or state abstractions. High-level abstractions can often lead to good strategic decision making, but tactical decision quality may suffer due to lost details. A competing method is to sample the search space which often leads to good tactical performance in simple scenarios, but poor high-level planning. We propose to use a deep convolutional neural network (CNN) to select among a limited set of abstract action choices, and to utilize the remaining computation time for game tree search to improve low level tactics. The CNN is trained by supervised learning on game states labelled by Puppet Search, a strategic search algorithm that uses action abstractions. The network is then used to select a script --- an abstract action --- to produce low level actions for all units. Subsequently, the game tree search algorithm improves the tactical actions of a subset of units using a limited view of the game state only considering units close to opponent units. Experiments in the microRTS game show that the combined algorithm results in higher win-rates than either of its two independent components and other state-of-the-art microRTS agents. To the best of our knowledge, this is the first successful application of a convolutional network to play a full RTS game on standard game maps, as previous work has focused on sub-problems, such as combat, or on very small maps.

연구 동기 및 목표

  • 고수준 전략 계획과 저수준 전술 정밀도 사이의 상충 관계를 해결하기 위해 고수준 추상화와 저수준 검색을 조합함으로써 RTS AI의 성능을 향상시키는 것.
  • 이전 연구가 작은 맵이나 부분 문제에 국한된 바에 비해, 딥 러닝을 전체 크기의 RTS 맵에 확장하는 것.
  • 빠른 정책 네트워크를 사용해 전술적 검색을 위한 시간을 확보함으로써 AI 성능을 향상시키고, 전략적 일관성을 유지하면서도 결정 품질을 높이는 것.
  • 기존의 단순화된 맵이나 부분 게임 시나리오가 아닌 표준 맵에서 전체 RTS 게임을 플레이하는 데 성공적으로 CNN을 적용한 최초의 사례를 보여주는 것.

제안 방법

  • 퍼펫 서치(Puppet Search)라는 전략적 검색 알고리즘을 사용해 행동 추상화를 적용한 게임 상태에 대해 지도학습을 통해 딥 컨volution 뉴럴 네트워크(CNN)를 훈련한다.
  • 정책 네트워크는 26개의 입력 특징 평면(유닛 유형, 체력, 소유주, 자원 수준 등을 나타냄)을 사용해 단일 유닛 제어를 위한 고수준 '스크립트'(추상적 행동 시퀀스)를 예측한다.
  • 정책 선택 후 남은 계산 시간은 나이브MCTS(NaïveMCTS)라는 전술적 검색 알고리즘에 할당되며, 이는 적 유닛 근처의 유닛에 대한 행동을 국소적 시야로 향상시킨다.
  • CNN의 추론 시간은 고정된 3ms이며, 나머지 시간(최대 80%)은 MCTS에 할당되며, 실험적 시간 분할 튜닝(퍼펫 서치에 20%, MCTS에 80%)을 통해 최적화된다.
  • 네트워크 아키텍처는 완전히 컨volutional이며, 파rameter 수를 늘리지 않고도 더 큰 맵에 스케일링 가능하며, 다양한 맵 크기 간 전이 학습을 지원한다.
  • 강화학습의 샘플 비효율성, 특히 RTS 게임에서의 희박한 보상 구조를 고려할 때, 레이블이 부여된 데이터를 활용해 이를 회피한다.

실험 결과

연구 질문

  • RQ1전략적 검색 출력에서 훈련된 딥 CNN이 전체 크기의 RTS 맵에 효과적으로 일반화되며 고수준 의사결정 품질을 유지할 수 있는가?
  • RQ2빠른 정책 네트워크와 시간 할당 전략적 검색 알고리즘을 조합하면 단독 전략 또는 전술 에이전트를 능가하는가?
  • RQ3하이브리드 아키텍처가 RTS 게임에서 전략적 추상화와 전술 정밀도 사이의 상충 관계를 완화할 수 있는가?
  • RQ4CNN 기반 에이전트의 성능이 퍼펫 서치에서 유래한 훈련 데이터의 질과 다양성에 얼마나 의존하는가?
  • RQ5제안된 완전히 컨volutional 아키텍처를 통해 전이 학습 또는 맵 간 일반화가 가능할 수 있는가?

주요 결과

  • 하이브리드 에이전트는 퍼펫 서치와의 대결에서 56.7%의 승률을 기록하여, 전략적 학습과 전술적 검색을 조합함으로써 전반적인 성능 향상이 이루어졌음을 입증했다.
  • 정책 네트워크만으로도 퍼펫 서치와 유사한 승률을 기록했지만, 추론 속도가 훨씬 빠르며(약 3ms), 전술적 검색을 위한 시간 재할당이 가능했다.
  • 정책 네트워크와 결합된 전술적 검색 구성요소(NaïveMCTS)는 특히 전투가 빈번한 상황에서 성능 향상에 기여했다.
  • 시스템은 개별 구성 요소와 다른 최신 기술 수준의 μRTS 에이전트를 모두 능가했으며, 표준 맵에서 전체 RTS 게임을 플레이하는 데 성공한 최초의 CNN 기반 에이전트로 기록되었다.
  • 네트워크의 게임 결과 예측 정확도는 더 큰 맵에서 더 높았는데, 이는 이러한 환경에서 장기적 전략 수립의 중요성이 더 크기 때문일 것이다.
  • 강력한 전반적 성능에도 불구하고, 정책 네트워크는 WorkerRush와 AHTN-P와 같은 특정 상대에 대해 약점을 보였으며, 이는 훈련 데이터에 잠재적인 데이터나 일반화 갭이 존재할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.