Skip to main content
QUICK REVIEW

[논문 리뷰] Student of Games: A unified learning algorithm for both perfect and imperfect information games

Martin Schmid, Matej Moravčík|arXiv (Cornell University)|2021. 12. 06.
Artificial Intelligence in Games인용 수 8
한 줄 요약

Student of Games (SoG)는 완전 정보 게임과 부분 정보 게임 양쪽에서 뛰어난 성능을 내기 위해 지도된 탐색, 자기대전 강화학습, 게임이론적 추론을 통합한 통합 학습 알고리즘이다. 이 알고리즘은 근사 최적 전략에 수렴하며, 체스, 고, 무한한 한정 Texas 홀드아임 포커, 스코틀랜드 야드에서 이전의 에이전트들을 능가한다. 이는 도메인 특화 설계를 최소화하면서도 다양한 게임 유형에 걸쳐 일반화됨을 보여준다.

ABSTRACT

Games have a long history as benchmarks for progress in artificial intelligence. Approaches using search and learning produced strong performance across many perfect information games, and approaches using game-theoretic reasoning and learning demonstrated strong performance for specific imperfect information poker variants. We introduce Student of Games, a general-purpose algorithm that unifies previous approaches, combining guided search, self-play learning, and game-theoretic reasoning. Student of Games achieves strong empirical performance in large perfect and imperfect information games -- an important step towards truly general algorithms for arbitrary environments. We prove that Student of Games is sound, converging to perfect play as available computation and approximation capacity increases. Student of Games reaches strong performance in chess and Go, beats the strongest openly available agent in heads-up no-limit Texas hold'em poker, and defeats the state-of-the-art agent in Scotland Yard, an imperfect information game that illustrates the value of guided search, learning, and game-theoretic reasoning.

연구 동기 및 목표

  • 완전 정보 및 부분 정보 게임 양쪽에서 자기대전 학습, 지도된 탐색, 게임이론적 추론을 통합하는 일반 목적 알고리즘을 개발하는 것.
  • 기존 알고리즘이 일반적으로 완전 정보 또는 부분 정보 게임 중 하나에 특화되어 있음에도 불구하고 양쪽에 모두 적용 가능한 점을 메우는 것.
  • 체스, 고, 포커, 스코틀랜드 야드와 같은 다양한 대규모 게임에서 광범위한 도메인 특화 지식 없이도 강력한 경험적 성능를 달성하는 것.
  • 계산 능력과 근사 능력이 증가함에 따라 알고리즘이 근사 최적 전략으로 수렴함을 증명하는 것.
  • 단일 알고리즘 아키텍처 프레임워크를 통해 다양한 게임 유형 간의 일반화를 보여주며 진정한 일반 강화학습 에이전트로의 도약을 이끌 것.

제안 방법

  • SoG는 성장하는 트리 기반의 반사적 위험 최소화(GT-CFR)를 사용하며, 이는 비균일하게 하위 게임을 확장하여 가장 관련성이 높은 미래 상태로 향하는 온라인 탐색 기법이다.
  • 정당한 자기대전 학습을 사용하여 과거 탐색 경로에서의 탐색 재귀적 분석과 게임 결과를 바탕으로 가치 및 정책 네트워크를 훈련한다.
  • 온라인 플레이 중 일致성과 낮은 탐색 가능성(exploitability)을 유지하기 위해 게임이론적 추론을 하위 게임 재해결을 통해 통합한다.
  • 신경망을 가치 및 정책 함수에 적용하며, 탐색 경험을 기반으로 한 자기대전 훈련을 통해 샘플 효율적인 학습을 가능하게 한다.
  • SoG는 재귀적 탐색과 가치 네트워크 부트스트랩 기법을 사용하여 체스, 고, 스코틀랜드 야드와 같은 장기 계획 수렴 게임에서의 계획 깊이와 정책 품질을 향상시킨다.
  • 이 프레임워크는 확장 가능한 관측 스토케스틱 게임(FOSG) 공식화에 기반하여, 확률적 노드와 의사결정 노드를 모두 모델링할 수 있다.

실험 결과

연구 질문

  • RQ1단일 알고리즘이 지도된 탐색, 자기대전 학습, 게임이론적 추론을 효과적으로 통합하여 완전 정보 및 부분 정보 게임 양쪽을 모두 정복할 수 있는가?
  • RQ2계산 자원과 모델 용량이 증가함에 따라 알고리즘이 근사 최적 전략으로 수렴하는가?
  • RQ3SoG는 체스, 고, 포커, 스코틀랜드 야드와 같은 다양한 게임 유형에 대해 아키텍처나 하이퍼파라미터의 큰 변화 없이 일반화할 수 있는가?
  • RQ4장기 계획 수렴과 은폐된 정보를 가진 게임에서 SoG의 성능은 최첨단 에이전트와 비교해 어떻게 되는가?
  • RQ5탐색 품질과 자기대전 학습이 탐색 가능성과 최종 정책 강도에 미치는 영향은 무엇인가?

주요 결과

  • 체스에서 SoG는 AlphaZero(모델 크기 s=16k, 탐색 시간 t=800k)에 비해 상대적 엘로 점수 +1970을 기록하여 완전 정보 게임에서 뛰어난 성능을 보였다.
  • 고에서 SoG는 비재귀적 접근 시 상대적 엘로 점수 +2025, 재귀적 쿼리 사용 시 +1838를 기록하여 여러 AlphaZero 설정을 능가했다.
  • 한 명의 상대와의 무한한 한정 Texas 홀드아임 포커에서 SoG는 가장 강력한 공개된 에이전트를 압도하여 부분 정보 환경에서의 우수성을 입증했다.
  • 장기 계획 수렴의 부분 정보 게임인 스코틀랜드 야드에서 SoG는 최첨단 에이전트를 능가했으며, 이는 지도된 탐색과 장기 계획의 가치를 입증했다.
  • 소규모 게임에서 계산 가능한 범위에서 SoG는 낮은 탐색 가능성을 보이며, 근사 네쉬 균형으로 수렴하는 정당성과 수렴성을 확인했다.
  • 하이퍼파라미터 설정에 관계없이 성능이 안정적이며, 다양한 탐색 시뮬레이션과 훈련 단계에서도 성능이 유연하게 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.