[논문 리뷰] Improving Hearthstone AI by Combining MCTS and Supervised Learning Algorithms
이 논문은 부분적으로 관찰 가능한 확률적인 카드 게임인 히어로스톤에서 의사결정 능력을 향상시키기 위해 몬테카를로 트리 탐색(MCTS)과 지도 학습을 융합한 하이브리드 히어로스톤 AI를 제시한다. 신경망을 통해 게임 상태를 평가하고 MCTS 탐색을 안내함으로써, 이 접근법은 최대 9%p까지 승률을 높였으며, 시간 제약 조건 하에서도 특히 효과적이었다. 이는 학습된 히ュ리스틱이 기본 MCTS에 비해 강도와 효율성을 크게 향상시킨다는 것을 보여준다.
We investigate the impact of supervised prediction models on the strength and efficiency of artificial agents that use the Monte-Carlo Tree Search (MCTS) algorithm to play a popular video game Hearthstone: Heroes of Warcraft. We overview our custom implementation of the MCTS that is well-suited for games with partially hidden information and random effects. We also describe experiments which we designed to quantify the performance of our Hearthstone agent's decision making. We show that even simple neural networks can be trained and successfully used for the evaluation of game states. Moreover, we demonstrate that by providing a guidance to the game state search heuristic, it is possible to substantially improve the win rate, and at the same time reduce the required computations.
연구 동기 및 목표
- 숨겨진 정보와 확률적 게임 메커니즘으로 인해 어려움을 겪는 MCTS 기반의 히어로스톤 AI의 성능과 효율성을 향상시키기 위해.
- 지도 학습 모델이 부분적으로 관찰 가능한 비결정론적 게임에서 MCTS 탐색 히ュ리스틱을 어떻게 안내할 수 있는지 조사하기 위해.
- 성능 향상을 위해 MCTS와 학습된 평가 함수를 융합한 하이브리드 AI 시스템을 설계하고 평가하기 위해.
- 결과로 도출된 에이전트를 인간 플레이어와 무작위 상대자와 비교하여 실제 전장에서의 경쟁력을 입증하기 위해.
- 자기 자신과의 대전과 모델 개선을 통해 더 강력한 히어로스톤 봇을 지속적으로 발전시킬 수 있는 확장 가능한 반복 학습 루프를 구축하기 위해.
제안 방법
- 히어로스톤의 무작위성과 불완전한 정보를 처리하기 위해 수정된 MCTS 알고리즘을 구현하였으며, 신뢰도 상태 관리를 위해 PIMC 및 ISMCTS 기법을 사용하였다.
- 고성능 MCTS 롤아웃을 가능하게 하기 위해 게임 상태를 효율적으로 시뮬레이션할 수 있는 맞춤형 게임 시뮬레이터를 개발하였다 (최대 10,000판/초).
- 역사적 게임 데이터를 기반으로 지도 학습을 통해 신경망을 훈련시켜 게임 상태의 가치를 예측하게 하였으며, 이는 히ュ리스틱 평가 함수로 기능하였다.
- MCTS 탐색은 게임 상태의 예상 결과를 추정하는 가치 네트워크에 의해 안내되어 무작위 롤아웃에 대한 의존도를 감소시켰다.
- 시뮬레이션 중 전술적 결단을 향상시키기 위해 전술적 공격 순서를 계산하는 보드 솔버를 통합하였다.
- 이전 버전의 에이전트와의 대전을 통해 반복 학습 루프를 활용하여 에이전트를 지속적으로 개선함으로써 점진적인 기량 향상을 달성하였다.
실험 결과
연구 질문
- RQ1지도 학습 모델이 히어로스톤의 부분적으로 관찰 가능한 환경과 확률적 요소가 존재하는 상황에서 MCTS의 의사결정 품질을 효과적으로 향상시킬 수 있는가?
- RQ2다양한 종류의 학습된 히ュ리스틱(예: 가치 네트워크, 보드 솔버)이 MCTS 성능과 계산 효율성에 어떤 영향을 미치는가?
- RQ3학습된 히ュ리스틱은 강력한 게임 플레이를 달성하기 위해 필요한 MCTS 시뮬레이션 수를 얼마나 줄일 수 있는가?
- RQ4학습된 히ュ리스틱의 성능 향상 정도는 플레이어의 선공/후공 역할과 데크 유형에 따라 어떻게 달라지는가?
- RQ5MCTS와 지도 학습을 융합한 하이브리드 시스템이 숙련된 인간 플레이어와의 경쟁에서 경쟁력을 확보할 수 있는가?
주요 결과
- 가치 네트워크와 보드 솔버의 통합으로, 1회 수순당 0.5초의 제한 시간 내에서도 봇의 승률이 최대 9%p 상승하였다.
- 기본 승률이 낮은(26.5%) 후공 플레이어의 경우, 히ュ리스틱을 적용함으로써 승률이 거의 두 배로 증가하여 최적 조건 하에서 최대 50%까지 도달하였다.
- 시간 제약이 심한 상황에서 히ュ리스틱의 성능 향상 효과가 가장 두드러졌으며, 이는 MCTS의 반복 횟수가 적을수록 학습된 모델의 안내가 탐색 깊이 부족을 상쇄함을 시사한다.
- 1초당 수순을 허용할 경우, 가치 네트워크만 사용하는 것과 가치 네트워크에 보드 솔버를 추가로 통합하는 것 간의 성능 격차는 거의 없어졌으며, 이는 시간 할당량이 많아질수록 수익 감소 현상이 나타남을 의미한다.
- 무작위 플레이어에 대해 100% 승률을 기록하였고, 레전드 등급의 인간 플레이어와의 대국에서도 승리를 거두었으며, 이는 뛰어난 실제 전장 성능을 의미한다.
- 인간 플레이어들은 봇이 매우 전략적이고 일관된 방식으로 플레이한다고 평가하였으며, 이는 기본적인 패tern 매칭을 넘어서는 고수준의 의사결정 능력을 갖추고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.