[논문 리뷰] Combining Prediction of Human Decisions with ISMCTS in Imperfect Information Games
이 논문은 인간 상대의 관측되지 않는 행동을 예측하는 모델링과 정보집합 MCTS를 결합하여 불완전 정보 게임에서 성능을 햖थ하는 새로운 MCTS 변종인 반결정화된 MCTS(SDMCTS)를 소개한다. 상대의 숨겨진 행동만 결정화하면서 다른 은닉 상태의 불확실성은 유지함으로써 전략 융합을 줄이고 행동 예측을 활용하여, 치트 게임에서 120명의 인간 플레이어와의 대결에서 88.97%의 승률을 기록했으며, 예측 정확도가 높아질수록 성능이 향상됨을 보였다.
Monte Carlo Tree Search (MCTS) has been extended to many imperfect information games. However, due to the added complexity that uncertainty introduces, these adaptations have not reached the same level of practical success as their perfect information counterparts. In this paper we consider the development of agents that perform well against humans in imperfect information games with partially observable actions. We introduce the Semi-Determinized-MCTS (SDMCTS), a variant of the Information Set MCTS algorithm (ISMCTS). More specifically, SDMCTS generates a predictive model of the unobservable portion of the opponent's actions from historical behavioral data. Next, SDMCTS performs simulations on an instance of the game where the unobservable portion of the opponent's actions are determined. Thereby, it facilitates the use of the predictive model in order to decrease uncertainty. We present an implementation of the SDMCTS applied to the Cheat Game, a well-known card game, with partially observable (and often deceptive) actions. Results from experiments with 120 subjects playing a head-to-head Cheat Game against our SDMCTS agents suggest that SDMCTS performs well against humans, and its performance improves as the predictive model's accuracy increases.
연구 동기 및 목표
- 부분적으로 관측 가능한 행동을 가진 불완전 정보 게임에서 인간과의 대결에서 잘 수행하는 에이전트를 개발하는 것.
- 관측되지 않는 상대의 행동으로 인한 불확실성 문제를 다루기 위해 ISMCTS의 한계를 해결하는 것.
- 인간 행동 예측 모델을 MCTS에 통합하여 전략 융합을 줄이고 의사결정을 향상시키는 것.
- 실제 인간 참가자를 대상으로 한 치트 게임에서 이 접근법을 평가하는 것.
제안 방법
- SDMCTS는 상대의 관측되지 않는 행동이 예측된 결정화된 게임 버전에서 시뮬레이션을 수행하는 정보집합 MCTS의 변종이다.
- 이전 인간 플레이 데이터를 기반으로 한 행동 기반 예측 모델을 사용하여 특정 행동의 가능성 확률을 추정한다.
- 예측 모델은 MCTS 시뮬레이션 중에 통합되어, 정보집합의 무결성을 유지하면서도 상대의 행동 가능성을 고려한 추론을 가능하게 한다.
- 정보집합 트리에서 탐색과 이용의 균형을 이루기 위해 Smooth-UCT를 선택 정책으로 사용한다.
- 은닉 정보(예: 상대의 카드)는 유지하면서, 불확실성을 줄이기 위해 상대의 수동 행동 부분만 결정화한다.
- 관측 가능한 행동 예측에 한정하여 결정화를 적용함으로써, 결정화의 이점(더 나은 시뮬레이션 품질)과 ISMCTS의 이점(전략 융합에 대한 강건성)을 동시에 확보한다.
실험 결과
연구 질문
- RQ1인간 행동 예측 모델링이 부분적으로 관측 가능한 행동을 가진 불완전 정보 게임에서 MCTS 성능을 향상시키는가?
- RQ2예측과 ISMCTS를 결합할 경우, 표준 ISMCTS와 비교해 인간 상대와의 대결에서 에이전트 성능에 어떤 영향을 미치는가?
- RQ3예측 모델의 정확도를 높일수록 에이전트의 승률과 게임 효율성에 측정 가능한 향상이 나타나는가?
- RQ4예측 모델을 사용하는 에이전트를 만날 때 인간 플레이어는 행동을 어떻게 적응하는가?
- RQ5SDMCTS 프레임워크는 치트 게임과 같은 실제 불완전 정보 게임에 효과적으로 적용될 수 있는가?
주요 결과
- SDMCTS 에이전트는 치트 게임에서 120명의 인간 플레이어와의 1:1 대결에서 88.97%의 승률을 기록하여 인간 상대와의 대결에서 뛰어난 성능을 보였다.
- 예측 모델은 치트 게임에서 인간의 전략적 결정을 예측할 때 AUC가 0.821을 기록하여 높은 정확도를 보였다.
- 예측 모델 정확도가 높아질수록 승률이 높아지고 상대와의 평균 카드 수 차이가 줄어들어 성능 향상이 확인되었다.
- 예측 기반 에이전트는 비예측 기반 에이전트보다 게임 라운드 수를 줄여 최종 상태에 더 빨리 도달함을 보여, 더 빠른 수렴을 보였다.
- 비예측 기반 에이전트와의 대결 대비 예측 기반 에이전트를 상대로 한 인간 플레이어는 거짓말을 덜 자주 했으며(40.4–42.4%), 비예측 기반 대비 44.8%에서 감소함을 보여 행동 적응이 일어났다.
- 높은 예측 정확도를 가진 FPMGA 에이전트는 ' Cheat를 신고한다'는 행동을 더 자주 사용하여 경기 종료까지 더 오래 걸렸으며, 이는 예측 정확도와 게임 속도 사이의 상충 관계를 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.