Skip to main content
QUICK REVIEW

[논문 리뷰] Pipeline PSRO: A Scalable Approach for Finding Approximate Nash Equilibria in Large Games

Stephen McAleer, John B. Lanier|arXiv (Cornell University)|2020. 06. 15.
Reinforcement Learning in Robotics참고 문헌 26인용 수 10
한 줄 요약

P2SRO는 병렬 강화학습 워커의 계층적 파이프라인을 사용하여 대규모 0-합의 완전 정보가 아닌 게임에서 근사 내쉬 균형을 효율적이고 수렴 가능한 방식으로 찾는 방법이다. 각 워커는 하위 수준의 고정 및 활성 정책의 메타-내쉬 균형과 대결하면서 학습한다. 이는 DCH 및 Rectified PSRO와 같은 기존의 PSRO 기반 방법보다 빠르게 수렴하고, Leduc 포커, 무작위 정규형 게임, 게임 트리 복잡도가 $10^{50}$인 Barrage Stratego에서 안정적으로 근사 균형에 도달한다.

ABSTRACT

Finding approximate Nash equilibria in zero-sum imperfect-information games is challenging when the number of information states is large. Policy Space Response Oracles (PSRO) is a deep reinforcement learning algorithm grounded in game theory that is guaranteed to converge to an approximate Nash equilibrium. However, PSRO requires training a reinforcement learning policy at each iteration, making it too slow for large games. We show through counterexamples and experiments that DCH and Rectified PSRO, two existing approaches to scaling up PSRO, fail to converge even in small games. We introduce Pipeline PSRO (P2SRO), the first scalable general method for finding approximate Nash equilibria in large zero-sum imperfect-information games. P2SRO is able to parallelize PSRO with convergence guarantees by maintaining a hierarchical pipeline of reinforcement learning workers, each training against the policies generated by lower levels in the hierarchy. We show that unlike existing methods, P2SRO converges to an approximate Nash equilibrium, and does so faster as the number of parallel workers increases, across a variety of imperfect information games. We also introduce an open-source environment for Barrage Stratego, a variant of Stratego with an approximate game tree complexity of $10^{50}$. P2SRO is able to achieve state-of-the-art performance on Barrage Stratego and beats all existing bots. Experiment code is available athttps://github.com/JBLanier/pipeline-psro.

연구 동기 및 목표

  • 기존의 PSRO 기반 방법이 대규모 0-합의 완전 정보가 아닌 게임에서 겪는 확장성 및 수렴 한계를 해결하기 위해.
  • 게임 이론적 수렴 보장을 유지하면서 학습 속도를 향상시키는 병렬 처리 가능한 PSRO 변종을 개발하기 위해.
  • Barrage Stratego와 같이 게임 트리 복잡도가 $10^{50​}$에 이르는 대규모 게임에서 안정적인 수렴과 최첨단 성능을 입증하기 위해.
  • Barrage Stratego용 오픈소스 환경을 제공하여 재현 가능한 연구 및 벤치마킹을 가능하게 하기 위해.

제안 방법

  • P2SRO는 각 워커가 하위 수준의 고정 정책과 하위 수준의 활성 정책의 메타-내쉬 균형과 대결하면서 활성 정책을 학습하는 계층적 파이프라인을 유지한다.
  • 정책은 학습을 중단한 고정 정책 또는 학습 중인 활성 정책로 분류되며, 새로운 활성 정책는 성능 향상이 정체될 때만 추가된다.
  • 기존의 DCH 및 Rectified PSRO와 달리 오래된 정책를 재학습하는 것에 의한 불안정성을 방지함으로써 근사 내쉬 균형으로의 수렴을 보장한다.
  • 임계값 기반 정지 기준을 사용한다: 최저 수준의 활성 정책의 성능 향상이 시간이 지남에 따라 임계값 이하로 떨어지면, 해당 정책는 고정되고 새로운 정책가 추가된다.
  • 이중 오라클 원칙을 활용하여 현재 정책 집합에 대한 최적 반응을 학습함으로써 이론적 수렴을 보장한다.
  • P2SRO는 병렬 워커 수에 따라 효율적으로 확장되도록 설계되어 컴퓨팅 자원이 증가할수록 수렴 속도가 빨라진다.

실험 결과

연구 질문

  • RQ1대규모 완전 정보가 아닌 게임에서 확장 가능하고 내쉬 균형으로 수렴하는 PSRO 기반 방법을 개발할 수 있는가?
  • RQ2DCH 및 Rectified PSRO와 같은 기존 병렬 PSRO 방법들은 이론적으로는 수렴한다고 주장하지만, 왜 작은 게임에서도 수렴하지 못하는가?
  • RQ3강화학습 워커의 계층적 파이프라인은 병렬 학습을 가능하게 하면서도 수렴성을 유지할 수 있는가?
  • RQ4P2SRO는 Barrage Stratego와 같이 복잡한 대규모 게임에서 최첨단 성능을 달성하는가?
  • RQ5Barrage Stratego용 오픈소스 환경은 내쉬 균형 탐색 알고리즘의 재현 가능한 벤치마킹을 가능하게 하는가?

주요 결과

  • 무작위 정규형 게임에서 P2SRO는 Naive PSRO, DCH, Rectified PSRO보다 근사 내쉬 균형으로 수렴하는 데 훨씬 더 빠르며, 평균 공격 가능도가 0.4 이하로 떨어지는 데 시간이 절반 이하로 소요된다.
  • Leduc 포커에서 P2SRO는 Naive PSRO보다 공격 가능도 0.4에 도달하는 데 거의 두 배 빠르며, DCH 및 Rectified PSRO는 낮은 공격 가능도로 수렴하지 못한다.
  • Barrage Stratego에서 P2SRO는 기존 봇들에 대해 평균 승률 71%를 기록했으며, 820,000 에피소드 후 각 개별 봇에 대해 승률이 65%를 초과했다.
  • P2SRO는 Barrage Stratego에서 모든 기존 봇을 능가하며, 게임 트리 복잡도가 약 $10^{50}$인 게임에서 최첨단 성능을 입증했다.
  • 저자들은 Rectified PSRO가 내쉬 균형으로 수렴하지 않음을 보여주는 반례를 제시했으며, 무작위 정규형 게임에서의 실패를 실험적으로 검증했다.
  • 오픈소스 Barrage Stratego 환경은 https://github.com/JBLanier/stratego_env 에서 공개되어 커뮤니티의 재현 가능성과 향후 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.