Skip to main content
QUICK REVIEW

[논문 리뷰] Train on Small, Play the Large: Scaling Up Board Games with AlphaZero and GNN

Shai Ben-Assayag, Ran El‐Yaniv|arXiv (Cornell University)|2021. 07. 18.
Educational Games and Gamification참고 문헌 27인용 수 4
한 줄 요약

이 논문은 작고 작은 체스판에서 학습하고 더 큰 체스판으로 일반화할 수 있도록 재설계된 강화학습 프레임워크인 ScalableAlphaZero(SAZ)를 제안한다. GNN과 AlphaZero 알고리즘을 결합하여 재훈련 없이도 큰 체스판에서 경쟁력을 유지한다. 컨볼루션 네트워크를 GNN으로 대체하고 예측 불확실성을 줄이기 위해 부분 그래프 샘플링 기법을 도입함으로써, SAZ는 3일간의 훈련으로도 30일간 훈련된 AlphaZero와 유사한 성능을 달성하며, 훈련 시간을 10배 단축시켰다. 이는 훨씬 뛰어난 확장성과 함께 성능을 보여준다.

ABSTRACT

Playing board games is considered a major challenge for both humans and AI researchers. Because some complicated board games are quite hard to learn, humans usually begin with playing on smaller boards and incrementally advance to master larger board strategies. Most neural network frameworks that are currently tasked with playing board games neither perform such incremental learning nor possess capabilities to automatically scale up. In this work, we look at the board as a graph and combine a graph neural network architecture inside the AlphaZero framework, along with some other innovative improvements. Our ScalableAlphaZero is capable of learning to play incrementally on small boards, and advancing to play on large ones. Our model can be trained quickly to play different challenging board games on multiple board sizes, without using any domain knowledge. We demonstrate the effectiveness of ScalableAlphaZero and show, for example, that by training it for only three days on small Othello boards, it can defeat the AlphaZero model on a large board, which was trained to play the large board for $30$ days.

연구 동기 및 목표

  • 재훈련 없이도 다양한 체스판 크기에서 확장 가능한 체스판 게임 전략을 학습할 수 있도록 딥 강화학습 에이전트를 가능하게 하기 위해.
  • AlphaZero의 고정된 입력 크기 요구 조건을 극복하기 위해, 내재적인 확장성을 지닌 그래프 신경망(GNN)으로 컨볼루션 신경망을 대체함으로써.
  • 새로운 부분 그래프 샘플링 기법을 통해 GNN 기반의 가치 및 정책 네트워크의 예측 불확실성을 줄이고 모델의 강건성을 향상시키기 위해.
  • 큰 체스판에서 장기간 훈련하는 것과 비교해도, 작은 체스판에서만 훈련된 에이전트가 경쟁력을 갖추며 계산 비용을 크게 절감할 수 있음을 입증하기 위해.

제안 방법

  • AlphaZero의 컨볼루션 신경망(CNN)을 그래프 신경망(GNN)으로 대체하여, 아키텍처 변경 없이도 가변 크기의 체스판 입력을 처리할 수 있도록 한다.
  • GNN을 사용해 체스판을 그래프로 인코딩하며, 각 교차점은 노드로, 인접한 교차점은 간선으로 연결되어, 어떤 체스판 크기에서나 공간적 의존성을 학습할 수 있도록 한다.
  • 부분 그래프 샘플링 도입: 전체 체스판에서 다수의 부분 그래프를 샘플링하고, 동일한 GNN을 사용해 각각을 처리한 후 예측 결과를 평균 내거나 앙상블하여 불확실성을 줄이고 강건성을 향상시킨다.
  • GNN 기반의 가치 및 정책 네트워크를 AlphaZero 프레임워크에 통합하여, 자기 대전을 통한 정책 개선을 위한 몬테카를로 트리 탐색(MCTS)을 사용한다.
  • 모델을 오직 작은 체스판(예: 9×9)에서만 훈련하고, 더 큰 체스판(예: 16×16, 20×20)에서의 성능을 미세조정 없이 평가한다.
  • 모든 체스판 크기에서 동일한 GNN 아키텍처를 공유하여, 입력 차원에 관계없이 일정한 파라미터 수를 유지한다.

실험 결과

연구 질문

  • RQ1Othello, Gomoku, Go와 같은 확장 가능한 게임에서, 작은 체스판 크기에서 훈련된 강화학습 에이전트가 훨씬 큰 체스판 크기로 효과적으로 일반화할 수 있는가?
  • RQ2AlphaZero의 CNN을 GNN으로 대체함으로써, 체스판 크기 간에 진정으로 확장 가능한 성능 향상을 달성할 수 있는가?
  • RQ3부분 그래프 샘플링 기법이 GNN 기반 에이전트의 예측 불확실성을 어느 정도 줄이고, 체스판 게임 환경에서의 일반화 능력을 향상시키는가?
  • RQ4큰 체스판에서 직접 훈련하지 않은 채로, 3일간 작은 체스판에서만 훈련된 모델이 30일간 큰 체스판에서 훈련된 AlphaZero 에이전트를 뛰어넘을 수 있는가?
  • RQ5큰 체스판에서 테스트했을 때, 확장 가능한 모델의 성능이 표준 AlphaZero와 비교해 어떻게 되는가? 특히 승률과 계산 효율성 측면에서.

주요 결과

  • 9×9 오델로 체스판에서 3일간 훈련한 ScalableAlphaZero(SAZ)는 16×16 체스판에서 30일간 훈련된 AlphaZero 에이전트와의 대결에서 54%의 승률을 기록했다.
  • 20×20 오델로 체스판에서 SAZ는 동일한 30일간 훈련된 AlphaZero 에이전트를 84%의 승률로 이겼으며, 더 큰 체스판으로의 강력한 일반화 능력을 보였다.
  • 19×19 고무쿠 체스판에서 SAZ는 같은 크기의 큰 체스판에서 훈련된 AlphaZero 모델과의 대결에서 100% 승률을 기록했으며, 해당 크기에서 직접 훈련한 바가 없음에도 불구하고 성능을 확보했다.
  • 절단 실험 결과, 부분 그래프 샘플링 기법을 제거할 경우 오델로에서 성능이 24% 감소하여, 이 기법이 불확실성 감소에 핵심적인 역할을 함을 확인했다.
  • 고에서 SAZ는 9×9 체스판에서 3일간 훈련한 결과, 9×9에서 20일간 훈련된 AlphaZero 에이전트와의 대결에서 68%의 승률을 기록했으며, 15×15에서 10일간 훈련된 모델과의 대결에선 77.5%의 승률을 기록했다.
  • 부분 그래프 샘플링 기법이 없는 모델(model4)은 오델로에서 승률이 28%로 낮게 나타났지만, 고무쿠에서는 98%로 향상되어, 일부 게임에서는 전체 체스판의 구조가 국소 패턴보다 더 중요하다는 점을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.