Skip to main content
QUICK REVIEW

[논문 리뷰] Building a Computer Mahjong Player via Deep Convolutional Neural Networks

Shiqi Gao, Fuminori Okuya|arXiv (Cornell University)|2019. 06. 05.
Artificial Intelligence in Games참고 문헌 5인용 수 5
한 줄 요약

이 논문은 풀리지 않은 Mahjong 게임 상태를 표현하기 위해 3D 컨volution 신경망(CNN) 모델을 제안한다. 이 모델은 타일 버림 예측을 정확하게 수행할 수 있도록 한다. 게임 기록을 기반으로 훈련된 모델는 인간 플레이와 70.44%의 일치율을 기록하며, 이는 이전 최고 성능(62.1%)을 크게 뛰어넘는 성과이다. 또한 규칙 기반 지식 없이도 Tenhou 플랫폼에서 1850 등급의 AI 에이전트를 구현하여 중수 수준의 인간 플레이어를 초월한다.

ABSTRACT

The evaluation function for imperfect information games is always hard to define but owns a significant impact on the playing strength of a program. Deep learning has made great achievements these years, and already exceeded the top human players' level even in the game of Go. In this paper, we introduce a new data model to represent the available imperfect information on the game table, and construct a well-designed convolutional neural network for game record training. We choose the accuracy of tile discarding which is also called as the agreement rate as the benchmark for this study. Our accuracy on test data reaches 70.44%, while the state-of-art baseline is 62.1% reported by Mizukami and Tsuruoka (2015), and is significantly higher than previous trials using deep learning, which shows the promising potential of our new model. For the AI program building, besides the tile discarding strategy, we adopt similar predicting strategies for other actions such as stealing (pon, chi, and kan) and riichi. With the simple combination of these several predicting networks and without any knowledge about the concrete rules of the game, a strength evaluation is made for the resulting program on the largest Japanese Mahjong site `Tenhou'. The program has achieved a rating of around 1850, which is significantly higher than that of an average human player and of programs among past studies.

연구 동기 및 목표

  • 일본 Mahjong의 불완전 정보를 딥러닝에 효과적으로 반영할 수 있는 데이터 모델을 설계하기.
  • 이전 게임 기록을 기반으로 훈련된 3D CNN 아키텍처를 활용해 타일 버림 예측 정확도를 향상시키기.
  • 다양한 훈련된 네트워크를 조합하여 행동 예측을 수행함으로써 규칙이 없는 AI 시스템의 강도 평가하기.
  • 딥 러닝이 법적 수순 제약 조건과 dora 지표와 같은 복잡한 게임 기능을 자동으로 학습할 수 있는지 탐색하기.

제안 방법

  • 2D 컨볼루션 레이어에 적합한 공간 형식으로 손패 타일, 버림 기록, dora 지표, 테이블 상태를 인코딩하는 새로운 3D 텐서 데이터 구조를 설계하였다.
  • 타일 버림을 34개 클래스 분류 문제로 간주하며, 입력 특징으로 플레이어의 손패, 버림 기록, dora 지표를 포함시켰다.
  • 다양한 컨볼루션 및 배치 정규화 레이어를 포함한 3D CNN 아키텍처를 사용하였으며, 정보 손실을 방지하기 위해 풀링 레이어를 배제하였다.
  • 최적의 인간 결정과의 일치도를 극대화하기 위해 전문 게임 기록(haifu)에서 추출한 50,000개의 테스트 케이스를 기반으로 엔드 투 엔드로 훈련하였다.
  • 규칙 기반 지식을 명시적으로 포함하지 않고도, 버림, 폭, 치, 칸, 리이치 행동을 위한 별도의 신경망을 조합하여 AI 에이전트를 구성하였다.
  • 온라인 플레이를 통해 Tenhou 플랫폼에서 강도 평가를 수행하였으며, 300판의 경기 후 등급을 측정하였다.

실험 결과

연구 질문

  • RQ1규칙을 명시적으로 인코딩하지 않고도 게임 기록 데이터만을 사용해 깊은 CNN 모델이 최적의 타일 버림을 예측할 수 있는가?
  • RQ22D 또는 1D 표현 방식에 비해 3D 표현 방식은 Mahjong 게임 상태의 복잡성을 얼마나 효과적으로 반영하는가?
  • RQ3깊은 신경망이 법적 수순 제약 조건과 dora 지표와 같은 복잡한 게임 기능을 어느 정도 자동으로 학습할 수 있는가?
  • RQ4이 구조적이고 저차원적인 게임 상태 표현에서 풀링 레이어가 성능에 악영향을 미치는가?
  • RQ5다양한 행동을 위한 별개로 훈련된 네트워크의 단순 앙상블은 강력한 규칙 없는 AI 플레이어를 생성할 수 있는가?

주요 결과

  • 제안된 3D CNN 모델은 테스트 데이터에서 인간 플레이와 70.44%의 일치율을 기록하였으며, 이는 이전 최고 성능인 62.1%를 크게 뛰어넘는 성과이다.
  • 모델은 오직 합법적인 버림만 예측한다—100%의 예측가지 손패의 14장 타일에 속해 있다—이는 이 모델이 암묵적으로 수순의 합법성 조건을 학습했다는 것을 시사한다.
  • 풀링 레이어는 성능을 떨어뜨리며, 이는 밀도 높은 3D 표현에서 세밀한 공간적 구조 손실 때문일 것이다.
  • 직접적인 인코딩 없이도 dora 지표에서 dora 타일을 정확히 추론할 수 있었으며, 이는 약 1%의 정확도 향상에 기여하였다.
  • 간단한 네트워크 조합으로 구성된 AI 에이전트는 Tenhou에서 1850 등급을 기록하였으며, 평균 중수 수준 플레이어(약 1600점)를 초월하였다.
  • GRU 기반 순차 모델도 시험되었지만 정적 3D CNN보다 성능이 열 劣하므로, 이 설정에서는 시간적 모델링보다 공간적 특징 학습이 더 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.