Skip to main content
QUICK REVIEW

[논문 리뷰] Regret Minimization in Non-Zero-Sum Games with Applications to Building Champion Multiplayer Computer Poker Agents

Richard G. Gibson|arXiv (Cornell University)|2013. 04. 30.
Artificial Intelligence in Games참고 문헌 24인용 수 8
한 줄 요약

이 논문은 비제로합 게임에서의 손실 최소화에 대한 이론적 기초를 확립하며, 역으로 엄격히 지배당하는 전략을 제거하는 카운터패널트 리그레스 미니마이제이션(CFR)의 성질을 증명한다. 이는 평균 전략 프로파일 대신 현재 전략 프로파일만 사용하는 수정된 CFR 버전을 도입함으로써 메모리 사용량을 절반으로 줄이고 계산 시간을 75% 감소시키면서도 성능을 유지함으로써, 더 강력한 다중 플레이어 포커 에이전트를 더 세밀한 추상화로 구현할 수 있도록 한다.

ABSTRACT

In two-player zero-sum games, if both players minimize their average external regret, then the average of the strategy profiles converges to a Nash equilibrium. For n-player general-sum games, however, theoretical guarantees for regret minimization are less understood. Nonetheless, Counterfactual Regret Minimization (CFR), a popular regret minimization algorithm for extensive-form games, has generated winning three-player Texas Hold'em agents in the Annual Computer Poker Competition (ACPC). In this paper, we provide the first set of theoretical properties for regret minimization algorithms in non-zero-sum games by proving that solutions eliminate iterative strict domination. We formally define \emph{dominated actions} in extensive-form games, show that CFR avoids iteratively strictly dominated actions and strategies, and demonstrate that removing iteratively dominated actions is enough to win a mock tournament in a small poker game. In addition, for two-player non-zero-sum games, we bound the worst case performance and show that in practice, regret minimization can yield strategies very close to equilibrium. Our theoretical advancements lead us to a new modification of CFR for games with more than two players that is more efficient and may be used to generate stronger strategies than previously possible. Furthermore, we present a new three-player Texas Hold'em poker agent that was built using CFR and a novel game decomposition method. Our new agent wins the three-player events of the 2012 ACPC and defeats the winning three-player programs from previous competitions while requiring less resources to generate than the 2011 winner. Finally, we show that our CFR modification computes a strategy of equal quality to our new agent in a quarter of the time of standard CFR using half the memory.

연구 동기 및 목표

  • 이전 연구에서 이론적 기초가 부족했던 비제로합 게임에서의 손실 최소화에 대한 이론적 보장을 제공하기 위해.
  • 광범위한 형태 게임에서 반복적으로 엄격히 지배당하는 행동과 전략을 공식적으로 정의하고 분석하기 위해.
  • 성능을 훼손하지 않으면서 효율성을 향상시킨 다중 플레이어 게임을 위한 수정된 CFR 알고리즘을 개발하기 위해.
  • 개선된 알고리즘을 적용하여 자원 요구량을 줄인 챔피언 수준의 세 명의 텍사스 홀드'em 포커 에이전트를 구축하기 위해.
  • 반복적으로 지배당하는 행동을 제거하는 것이 작은 포커 게임에서 승리하는 데 충분한가를 입증하기 위해.

제안 방법

  • 논문은 광범위한 형태 게임에서 반복적으로 엄격히 지배당하는 행동을 공식적으로 정의하고, 미약한 조건 하에서 CFR가 이러한 행동을 피함을 증명한다.
  • 정규형 게임에서 손실 최소화가 반복적으로 엄격히 지배당하는 전략을 제거함을 확립한다.
  • 이중 플레이어 비제로합 게임에서, 평균 전략 프로파일의 최악의 성능을 경계함으로써 실질적으로 균형점에 가까운 성능을 유지함을 보여준다.
  • 기존의 평균 전략 프로파일을 기각하고 현재 프로파일만 사용하는 새로운 CFR 수정 방식을 제안함으로써, 메모리 사용량을 절반으로 줄이고 속도를 75% 향상시킨다.
  • 게임 분해 기법을 통합하여 전략적 중요도에 따라 추상화 품질을 조절함으로써, 큰 게임에서의 효율성을 향상시킨다.
  • 이 방법은 수정된 CFR를 사용해 구축된 새로운 세 명의 텍사스 홀드'em 에이전트를 통해 연간 컴퓨터 포커 경쟁(ACPC)에서 검증되었다.

실험 결과

연구 질문

  • RQ1비제로합 게임에서의 손실 최소화 알고리즘은 반복적으로 엄격히 지배당하는 전략의 제거를 통해 이론적으로 정당화될 수 있는가?
  • RQ2CFR는 광범위한 형태 게임에서 반복적으로 엄격히 지배당하는 전략을 피하거나 학습하는가?
  • RQ3평균을 사용하는 대신 현재 프로파일만 사용하는 수정된 CFR는 메모리와 시간을 줄이면서도 동일하거나 더 나은 성능을 달성할 수 있는가?
  • RQ4반복적으로 지배당하는 행동을 제거하는 것이 작은 포커 게임에서 강력한 전략을 생성하는 데 충분한가?
  • RQ5메모리 사용량 감소로 인해 더 세밀한 추상화를 가능하게 하는 수정된 CFR는 더 강력한 다중 플레이어 포커 에이전트의 실현 가능성을 높이는가?

주요 결과

  • 논문은 정규형 게임에서 손실 최소화가 반복적으로 엄격히 지배당하는 전략을 제거함을 증명하며, 일반합 게임에서의 적용에 대한 이론적 기초를 제공한다.
  • CFR는 표준 조건 하에서 광범위한 형태 게임에서 반복적으로 엄격히 지배당하는 행동과 전략을 피함을 입증하며, 그 견고성을 확인한다.
  • 이중 플레이어 비제로합 게임에서, 손실 최소화로부터 유도된 평균 전략 프로파일은 균형점과 유한한 거리 내에 있으며, 실증 결과는 균형점에 매우 가까운 성능을 보여준다.
  • 현재 프로파일만 사용하는 수정된 CFR 알고리즘은 표준 CFR 대비 시간은 4분의 1로 줄이고, 메모리 사용량은 절반으로 줄이며 동일한 전략 품질을 달성한다.
  • 수정된 CFR와 게임 분해를 활용해 제작된 새로운 세 명의 텍사스 홀드'em 에이전트는 2012년 ACPC 세 명의 텍사스 홀드'em 대회에서 우승했으며, 이전 우승자들보다 자원 소비를 줄였음에도 불구하고 뛰어난 성능을 보였다.
  • 작은 포커 게임에서 반복적으로 지배당하는 행동을 제거하는 것이 모의 토너먼트에서 승리하는 데 충분했으며, 이는 이론적 결과의 실용적 영향을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.