Skip to main content
QUICK REVIEW

[논문 리뷰] Method for Constructing Artificial Intelligence Player with Abstraction to Markov Decision Processes in Multiplayer Game of Mahjong

Moyuru Kurita, Kunihito Hoki|arXiv (Cornell University)|2019. 04. 16.
Artificial Intelligence in Games참고 문헌 12인용 수 5
한 줄 요약

이 논문은 다중 플레이어 마작에서 전문가 수준의 AI 플레이어를 구축하기 위한 새로운 방법을 제안한다. 게임을 극도로 큰 게임 트리와 완전하지 않은 정보를 가진 상황에서 관리하기 위해 다수의 마르코프 결정 과정(MDPs)으로 추상화한다. 이 방법은 행동 가치를 추정하기 위해 MDP를 사용하며, 전문 플레이어의 행동 전략을 통합하고 후행 분석 및 가치 함수 추론을 적용한다. 이 AI는 세계 최고 수준의 성능을 달성하여, 3,557판의 경기에서 가장 강력한 기존 AI인 Bakuuchi를 상대로 통계적으로 유의미한 평균 순위 우위 0.0574를 기록했다 (p = 0.03).

ABSTRACT

We propose a method for constructing artificial intelligence (AI) of mahjong, which is a multiplayer imperfect information game. Since the size of the game tree is huge, constructing an expert-level AI player of mahjong is challenging. We define multiple Markov decision processes (MDPs) as abstractions of mahjong to construct effective search trees. We also introduce two methods of inferring state values of the original mahjong using these MDPs. We evaluated the effectiveness of our method using gameplays vis-à-vis the current strongest AI player.

연구 동기 및 목표

  • 다중 플레이어 마작, 즉 극도로 큰 게임 트리와 높은 불확실성을 지닌 완전하지 않은 정보 게임에서 고수준 AI 플레이어를 구축하는 데 도전하는 것.
  • 핵심 게임 플레이나 시나리오를 모델링하는 다수의 마르코프 결정 과정(MDPs)으로 게임을 추상화함으로써 마작 AI의 계산 복잡도를 감소시키는 것.
  • 이러한 MDP 추상화에서 유도된 가치 함수를 활용하여 원래 게임에서 행동 가치 추정을 향상시키는 것.
  • 기존 최강 AI인 Bakuuchi와의 대결을 통해 실제 경기에서의 경쟁 우위를 입증함으로써 방법의 타당성을 검증하는 것.

제안 방법

  • 마작을 네 가지 서로 다른 MDP로 추상화한다: $\cal{M}_{\text{win}}$, $\cal{M}_{\text{tenpai}}$, $\cal{M}_{\text{fold}}$, 및 $\cal{M}$, 각각 특정한 엔딩 게임 또는 의사결정 시나리오를 모델링한다.
  • 전문 플레이어의 게임 기록과 저자의 경험을 바탕으로 세 명의 상대 플레이어를 나타내는 확률적 플레이어의 행동 확률을 추론함으로써 상대 플레이어 행동을 시뮬레이션할 수 있도록 한다.
  • 후행 분석과 가치 함수 추론을 적용하여 MDP 추상화 결과를 바탕으로 원래 게임의 상태 가치를 추정한다.
  • 탐욕 전략을 사용한다: 다양한 식 (16 및 17)을 기반으로, 0–1과 2–3의 샌텐 수에 따라 최고의 가치를 가진 행동을 선택한다.
  • 샌텐 수 > 3인 손에 대해서는, $\cal{M}_{\text{fold}}$를 사용한 가치 추정을 바탕으로 샌텐 수를 최소화하거나 포기하는 것을 목표로 하는 규칙 기반 전략을 적용한다.
  • 계산이 몇 초 내로 완료되도록 MDP 상태 공간을 조정함으로써 기대 최종 순위 오차를 낮추면서도 효율적인 계산을 유도한다.

실험 결과

연구 질문

  • RQ1다수의 MDP 추상화가 불완전 정보를 가진 다중 플레이어 마작에서 복잡한 의사결정을 효과적으로 모델링할 수 있는가?
  • RQ2MDP에서 유도된 가치 함수를 어떻게 활용하여 정확한 상태 가치를 보다 광범위한 탐색 없이도 원래 게임에서 추론할 수 있는가?
  • RQ3제안된 추상화 방법이 존재하는 최신 기술 수준의 AI 플레이어를 초월하는 성능을 달성할 수 있는가?
  • RQ4승리, 텐파이, 포기 시나리오에 집중한 MDP 추상화가 고수 수준의 마작 플레이에서 의사결정 품질을 얼마나 향상시키는가?

주요 결과

  • 제안된 AI 플레이어는 톤푸 규칙 하에 3,557판의 경기에서 평균 최종 순위 2.23 ± 0.04를 기록했으며, 이는 Bakuuchi(2.29 ± 0.04)를 뚜렷이 앞서는 성과였다.
  • 성과의 차이는 통계적으로 유의미했으며, 단측 검정 p-값 0.03으로, 제안된 AI가 Bakuuchi보다 97% 신뢰 수준에서 우월하다는 것을 시사한다.
  • AI는 33%의 경기를 승리했으며, Bakuuchi의 32%에 이어 두 번째로 높은 승률을 기록했고, 61%의 경기에서 상위 두 순위에 진입하여 높은 일관성을 보였다.
  • MDP 상태 공간을 제한함으로써 계산 부담을 효과적으로 줄였으며, 기대 최종 순위 오차는 낮게 유지되어 한 수수의 수를 1초 이내로 처리할 수 있었다.
  • 저샌텐 상태에서의 가치 추정을 위한 MDP의 활용은 정확한 평가가 승리 결정에 필수적인 상황에서 핵심적인 역할을 했다.
  • 샌텐 수 > 3인 손에 대한 규칙 기반 전략은 위험과 승리 손을 햖向着한 진전 사이의 균형을 효과적으로 유지하여 전체적인 강건성을 높였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.