Skip to main content
QUICK REVIEW

[논문 리뷰] Solving Large Sequential Games with the Excessive Gap Technique

Christian Kroer, Gabriele Farina|arXiv (Cornell University)|2018. 10. 07.
Artificial Intelligence in Games인용 수 17
한 줄 요약

이 논문은 광범위한 순차적 게임을 해결하기 위해 확장형 게임에서 전략 공간을 모델링하기 위해 확장된 갭 기법(EGT)의 실용적이고 GPU 가속화된 변종을 소개한다. 이는 확대된 엔트로피 거리 생성 함수를 사용하며, 실제 무제한 텍사스 홀드아임 엔드게임에서 대조적 위험 최소화(CFR) 변종과 경쟁 가능한 성능을 보이며, CFR+의 수준의 해 품질을 두 배 이내로 유지하면서도 이론적으로 우월한 1/T 수렴 속도를 유지한다.

ABSTRACT

There has been tremendous recent progress on equilibrium-finding algorithms for zero-sum imperfect-information extensive-form games, but there has been a puzzling gap between theory and practice. First-order methods have significantly better theoretical convergence rates than any counterfactual-regret minimization (CFR) variant. Despite this, CFR variants have been favored in practice. Experiments with first-order methods have only been conducted on small- and medium-sized games because those methods are complicated to implement in this setting, and because CFR variants have been enhanced extensively for over a decade they perform well in practice. In this paper we show that a particular first-order method, a state-of-the-art variant of the excessive gap technique---instantiated with the dilated entropy distance function---can efficiently solve large real-world problems competitively with CFR and its variants. We show this on large endgames encountered by the Libratus poker AI, which recently beat top human poker specialist professionals at no-limit Texas hold'em. We show experimental results on our variant of the excessive gap technique as well as a prior version. We introduce a numerically friendly implementation of the smoothed best response computation associated with first-order methods for extensive-form game solving. We present, to our knowledge, the first GPU implementation of a first-order method for extensive-form games. We present comparisons of several excessive gap technique and CFR variants.

연구 동기 및 목표

  • 일阶 방법(FOMs)의 이론적 수렴 우월성과 대규모 순차적 게임에서의 실용적 미사용 간 격차를 해소하기 위해.
  • FOMs, 특히 확장된 갭 기법(EGT)의 변종이 Libratus 포커 AI에서 실제 사용되는 대규모 엔드게임을 효율적으로 해결할 수 있음을 보여주기 위해.
  • EGF에 대한 핵심 서브루틴인 스무딩 최적 반응과 프록스 매핑의 수치적 안정성과 효율성 있는 구현을 개발하기 위해.
  • GPU 병렬 처리와 적극적인 스텝 사이즈 조정을 통해 FOMs의 실용적 구현을 가능하게 하기 위해.
  • 실제로 세밀한 추상화를 적용한 무제한 텍사스 홀드아임의 경우에 FOMs와 CFR 변종을 비교하여, FOMs가 실생활에서 경쟁 가능하다는 것을 보여주기 위해.

제안 방법

  • 논문은 광범위한 순차적 게임에서 전략 공간을 모델링하기 위해 확대된 엔트로피 거리 생성 함수(DGF)를 사용하는 최신 기술의 EGT 변종을 사용한다.
  • 확장형 게임(EFGs)에서 EGT의 핵심 구성 요소인 스무딩 최적 반응(SBR)을 계산하기 위한 수치적 안정성과 효율성이 확보된 알고리즘을 도입한다.
  • 게임 트리에서 수치적 안정성과 성능을 고려해 최적화된 프록스 매핑 계산을 포함한다.
  • 전략 트리의 루트에서 카르테시안 곱 연산을 사용하여 전략 업데이트의 병렬 계산을 가능하게 하기 위해 GPU 구현을 개발한다.
  • 알고리즘은 수렴을 가속화하기 위해 적극적인 스텝 사이즈 선택과 동적 μ-균형 조정을 사용한다.
  • 해법은 실제 생산 환경에서 사용된 정확한 세밀한 베팅 추상화를 적용한 Libratus 포커 AI의 엔드게임에서 평가된다.

실험 결과

연구 질문

  • RQ1실제로 대규모이고 현실적인 순차적 게임에서, EGT와 같은 일阶 방법이 CFR 변종보다 성능이 뛰어날 수 있는가?
  • RQ2고급 DGF와 최적화 기법을 사용하여, EGT가 대규모 EFG에 대해 수치적으로 안정적이고 효율적으로 작동할 수 있는가?
  • RQ3GPU 가속화가 광범위한 순차적 게임 해결에서 EGT의 성능을 크게 향상시키는가?
  • RQ4반복 횟수 대비 기울기 계산 횟수로 측정했을 때, EGT의 수렴 속도는 CFR+와 어떻게 비교되는가?
  • RQ5EGT가 CFR+와 유사한 실용적 효율성을 달성하면서도 이론적 1/T 수렴 속도를 유지할 수 있는가?

주요 결과

  • 제안된 EGT 변종은 실제 Libratus 엔드게임에서 CFR+의 수준의 해 품질을 두 배 이내로 달성하여 강력한 실용적 경쟁력을 입증한다.
  • 동일한 테스트 게임에서 EGT는 회귀 매칭(RM)과 RM+보다 수렴 속도와 최종 해 품질 측면에서 뛰어나다.
  • 반복당 기울기 계산 횟수가 더 많음에도 불구하고, EGT는 1/T 수렴 속도를 유지하며, 반면 CFR+는 최적화의 후반부로 갈수록 속도가 떨어지기 시작한다.
  • 총 기울기 계산 횟수로 측정했을 때, EGT/as와 EGT는 CFR+보다 略로 떨어지지만, 이론적 수렴 보장에 비해 여전히 뛰어난 효율성을 보이며, 특히 이론적 수렴 보장에 비해 뛰어난 효율성을 보인다.
  • GPU 구현은 전략 업데이트의 병렬 계산을 가능하게 하여 대규모 게임 트리에서 알고리즘의 가속화를 크게 이룬다.
  • 저자들은 향후 더 많은 파rameter 조정과 알고리즘 개선을 통해 EGT가 CFR+를 뛰어넘는 속도를 달성할 수 있을 것이라고 관찰한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.