Skip to main content
QUICK REVIEW

[논문 리뷰] Evolving winning strategies for Nim-like games

Mihai Oltean|arXiv (Cornell University)|2021. 08. 21.
Artificial Intelligence in Games참고 문헌 9인용 수 10
한 줄 요약

이 논문은 멀티 엑스프레션 프로그래밍(MEP)을 사용한 진화적 접근을 제안하여 나이밍 유사 게임의 승리 전략을 자동으로 발견한다. 게임 위치를 P-위치(지각) 또는 N-위치(이기기)로 분류하는 수학적 표현을 진화시킴으로써, 이 방법은 나이밍에서 표준 XOR 기반 승리 조건을 성공적으로 학습하여 다양한 실험 설정에서 높은 성공률을 달성한다.

ABSTRACT

An evolutionary approach for computing the winning strategy for Nim-like games is proposed in this paper. The winning strategy is computed by using the Multi Expression Programming (MEP) technique - a fast and efficient variant of the Genetic Programming (GP). Each play strategy is represented by a mathematical expression that contains mathematical operators (such as +, -, *, mod, div, and , or, xor, not) and operands (encoding the current game state). Several numerical experiments for computing the winning strategy for the Nim game are performed. The computational effort needed for evolving a winning strategy is reported. The results show that the proposed evolutionary approach is very suitable for computing the winning strategy for Nim-like games.

연구 동기 및 목표

  • 기본 이론 지식에 의존하지 않고 나이밍 유사 게임에서의 승리 전략을 발견하기 위한 진화적 방법을 개발하는 것.
  • 기본 이론 지식 없이 게임 이론에서 기호 회귀를 위한 전통적 유전자 프로그래밍의 빠르고 효율적인 대안으로 멀티 엑스프레션 프로그래밍(MEP)을 적용하는 것.
  • 나이밍 게임에서 게임 상태를 P-위치(지각) 또는 N-위치(이기기)로 올바르게 분류하는 수학적 표현을 진화시키는 것.
  • 모집단 크기, 세대 수, 염색체 길이와 같은 핵심 알고리즘 매개변수들이 전략 발견 성공률에 미치는 영향을 평가하는 것.
  • P/N-위치 이론에 기반한 다른 순수 게임들에 대해서도 이 접근법의 일반화 가능성과 적용 가능성을 보여주는 것.

제안 방법

  • 모든 개체는 고정 길이의 염색체로 표현되며, 각 유전자는 종료 조건(게임 상태 변수) 또는 함수(+, -, *, xor, mod, and, or, not 등)를 인코딩한다.
  • MEP 표현 방식은 선형적이고 스택 기반의 인코딩을 사용하여 함수의 인수를 인덱스로 참조함으로써 문법적 타당성을 보장하고, 한 염색체에 여러 표현식을 효율적으로 평가할 수 있도록 한다.
  • 적합도는 (4,4,4,4) 나이밍 게임의 70개의 고유한 게임 구성이 P-위치 또는 N-위치로 올바르게 분류되는지를 기반으로 할당된다.
  • 진화 과정은 이진 토너먼트 선택, 0.9의 교차 확률, 각 염색체당 2회의 돌연변이를 사용하여 다양성을 유지하고 수렴을 이끌어낸다.
  • 검색 과정은 P-위치에 대해 0을 반환하고 N-위치에 대해 0이 아닌 값을 반환하는 표현식을 향해 유도되며, 이는 이진 분류 타겟을 가진 기호 회귀 작업을 효과적으로 해결하는 방식이다.
  • 이 방법은 게임 트리를 순회하여 동적으로 P/N-위치를 식별함으로써 사전에 레이블이 부여된 데이터셋이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1기본 이론 지식 없이 멀티 엑스프레션 프로그래밍이 나이밍 게임에 대해 정확하고 일반화 가능한 승리 전략을 진화시킬 수 있는가?
  • RQ2모집단 크기, 세대 수, 염색체 길이가 승리 전략 발견 성공률에 어떤 영향을 미치는가?
  • RQ3진화된 표현식이 알려진 XOR 기반 솔루션과 일치하거나 이를 초월하여 일반화할 수 있는가?
  • RQ4MEP 기반 접근법은 P/N-위치 구조를 가진 다른 순수 게임에 대해 확장 가능하고 효과적인가?
  • RQ5이론적 해답이 사전에 알려져 있지 않은 경우, 진화 계산이 조합 게임에서 기호 규칙을 얼마나 잘 발견할 수 있는가?

주요 결과

  • 모집단 크기가 140일 경우, 50회의 실행 중 37회에서 성공률을 기록하여 모집단 크기와 성공률 사이에 강한 정적 상관관계를 보였다.
  • 100세대 이후, 50회의 실행 중 41회가 승리 전략을 성공적으로 발견하여 표준 설정 하에서 높은 수렴 안정성을 보였다.
  • 최적의 염색체 길이는 35유전자로, 50회의 실행 중 25회에서 성공을 기록하여 표현식의 복잡성과 탐색 효율성 사이의 트레이드오프를 시사했다.
  • MEP는 $a_1 \text{ xor } a_2 \text{ xor } a_3 - a_4$와 같은 다른 올바른 수식도 성공적으로 진화시켰으며, XOR 연산자의 성질 덕분에 이는 수학적으로 타당하다.
  • 작은 설정(예: 20명의 개체)에서도 높은 성공률를 기록하여 소규모 탐색 공간에서의 강건성과 효율성을 입증했다.
  • 이 방법은 P/N-위치 분류에 기반한 다른 순수 게임으로도 일반화 가능하며, 게임 트리 순회 및 상태 평가의 기본 논리가 이식 가능하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.