Skip to main content
QUICK REVIEW

[논문 리뷰] Monte Carlo Q-learning for General Game Playing

Hui Wang, Michael Emmerich|arXiv (Cornell University)|2018. 02. 16.
Artificial Intelligence in Games참고 문헌 14인용 수 14
한 줄 요약

이 논문은 일반 게임 플레이(GGP)에서 수렴 속도를 향상시키기 위해 몬테카를로 탐색(MCS)을 Q-학습 루프에 통합한 하이브리드 강화학습 접근법인 QM-학습을 제안한다. 틱택토, 올리브포커, 헕게이트와 같은 작은 게임에서 평가된 QM-학습은 표준 Q-학습에 비해 학습 속도와 승률을 크게 향상시켰으며, 무작위 플레이어와의 대결에서 87.5%의 승률을 기록했지만, 여전히 작은 게임에서 MCTS의 완벽한 플레이에 못 미친다.

ABSTRACT

After the recent groundbreaking results of AlphaGo, we have seen a strong interest in reinforcement learning in game playing. General Game Playing (GGP) provides a good testbed for reinforcement learning. In GGP, a specification of games rules is given. GGP problems can be solved by reinforcement learning. Q-learning is one of the canonical reinforcement learning methods, and has been used by (Banerjee & Stone, IJCAI 2007) in GGP. In this paper we implement Q-learning in GGP for three small-board games (Tic-Tac-Toe, Connect Four, Hex), to allow comparison to Banerjee et al. As expected, Q-learning converges, although much slower than MCTS. Borrowing an idea from MCTS, we enhance Q-learning with Monte Carlo Search, to give QM-learning. This enhancement improves the performance of pure Q-learning. We believe that QM-learning can also be used to improve performance of reinforcement learning further for larger games, something which we will test in future work.

연구 동기 및 목표

  • 일반 게임 플레이(GGP) 환경에서 고전적인 테이블 기반 Q-학습의 성능과 수렴 속도를 평가하는 것.
  • Q-학습의 느린 수렴 문제를 해결하기 위해 몬테카를로 탐색(MCS)을 Q-학습 루프에 통합하는 것.
  • 소규모 양자 게임, 두 명의 플레이어가 참여하는 0-합 게임에서 QM-학습을 MCTS 및 기본 Q-학습과 비교하는 것.
  • 적응형 이psilon 스케줄링이 GGP에서 Q-학습 성능에 미치는 영향을 조사하는 것.
  • QM-학습을 더 큰 게임이나 신경망 기반 구현으로 확장할 수 있는지 탐색하는 것.

제안 방법

  • 틱택토, 올리브포커, 헕게이트와 같은 세 가지 작은 GGP 게임에 대해 테이블 기반 Q-학습을 구현한다.
  • 몬테카를로 탐색(MCS)을 Q-학습 업데이트 루프에 통합하여 QM-학습을 만들며, 학습 중 동작 선택을 MCS가 이끌도록 한다.
  • 두 플레이어 게임에서 상대방 모델링을 위해 교차하는 최대화 및 최소화 전략을 사용한 UCT 스타일의 트리 정책을 적용한다.
  • 학습 단계에 따라 감소하는 동적 이psilon-그리디 전략을 적용하여 탐색과 이용의 균형을 이룬다.
  • 모든 수에 대해 MCS를 50ms로 제한하여 실시간 제약 조건을 시뮬레이션하며, 10초의 MCTS 시간 제한과 대비한다.
  • 매치를 실행하고 성능 데이터를 수집하기 위해 게임 매니저(GM)와 GDL 인터프리터를 사용한다.

실험 결과

연구 질문

  • RQ1고전적인 Q-학습은 일반 게임 플레이 환경에서 수렴하는가? 그리고 MCTS와 비교해 수렴 속도는 어떻게 되는가?
  • RQ2Q-학습 루프에 몬테카를로 탐색을 통합하면 학습 효율성과 최종 성능이 크게 향상되는가?
  • RQ3적응형 이psilon 스케줄링은 GGP에서 Q-학습의 수렴과 승률에 어떤 영향을 미치는가?
  • RQ4QM-학습은 틱택토와 같은 소규모 GGP 게임에서 표준 Q-학습보다 얼마나 뛰어나게 성능을 내는가?
  • RQ5QM-학습 프레임워크는 더 큰 게임으로 확장되거나 딥러닝 아키텍처와 결합될 수 있는가?

주요 결과

  • 고전적인 Q-학습은 GGP 게임에서 수렴하지만, MCTS에 비해 상당히 느린 학습 속도를 보이며, 틱택토에서는 완벽한 플레이에 도달하지 못한다.
  • QM-학습은 MCS를 Q-학습 루프에 통합하여 수렴 속도와 성능을 향상시켰으며, 무작위 플레이어와의 대결에서 87.5%의 승률을 기록했고, Q-학습의 86.5%보다 略적으로 높았다.
  • MCTS는 상태 공간이 작은 틱택토에서 완벽한 플레이를 달성하여 QPlayer 및 QMPlayer와의 대결에서 100%의 승률을 기록했다.
  • QM-학습은 초기 학습 단계에서 Q-학습을 능가하며, MCS에 의해 이끌린 탐색 덕분에 고보상 전략을 더 빨리 학습한다.
  • 시간이 지남에 따라 탐색을 감소시키는 동적 이psilon 스케줄링은 고정된 이psilon보다 더 나은 성능을 내며, 수렴을 향상시킨다.
  • 개선에도 불구하고 QM-학습은 여전히 작은 게임에서 MCTS의 성능을 따라오지 못하며, 더 깊은 아키텍처 확장 없이도 확장성에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.