Skip to main content
QUICK REVIEW

[논문 리뷰] XDO: A Double Oracle Algorithm for Extensive-Form Games

Stephen McAleer, John B. Lanier|arXiv (Cornell University)|2021. 03. 11.
Reinforcement Learning in Robotics참고 문헌 26인용 수 5
한 줄 요약

이 논문은 광범위한 형식 게임에 대해 수렴 시간이 정보 상태 수에 선형적인 반복 횟수로 보장되는 새로운 더블 오라클 알고리즘인 XDO를 소개한다—PSRO에 비해 크게 향상된 성능이다. PSRO는 반복 횟수가 지수적으로 증가할 수 있으나, XDO는 정보 상태 수에 비례해 수렴한다. 이 방법은 루트에서만이 아니라 모든 정보 상태에서 최적 반응(best response)을 계산하며, 그 신경망 변형인 NXDO는 고차원 연속 행동 순차 게임에서 근사 넷쇼우 균형을 찾는 최초의 딥 강화학습 방법이다.

ABSTRACT

Policy Space Response Oracles (PSRO) is a reinforcement learning (RL) algorithm for two-player zero-sum games that has been empirically shown to find approximate Nash equilibria in large games. Although PSRO is guaranteed to converge to an approximate Nash equilibrium and can handle continuous actions, it may take an exponential number of iterations as the number of information states (infostates) grows. We propose Extensive-Form Double Oracle (XDO), an extensive-form double oracle algorithm for two-player zero-sum games that is guaranteed to converge to an approximate Nash equilibrium linearly in the number of infostates. Unlike PSRO, which mixes best responses at the root of the game, XDO mixes best responses at every infostate. We also introduce Neural XDO (NXDO), where the best response is learned through deep RL. In tabular experiments on Leduc poker, we find that XDO achieves an approximate Nash equilibrium in a number of iterations an order of magnitude smaller than PSRO. Experiments on a modified Leduc poker game and Oshi-Zumo show that tabular XDO achieves a lower exploitability than CFR with the same amount of computation. We also find that NXDO outperforms PSRO and NFSP on a sequential multidimensional continuous-action game. NXDO is the first deep RL method that can find an approximate Nash equilibrium in high-dimensional continuous-action sequential games. Experiment code is available at https://github.com/indylab/nxdo.

연구 동기 및 목표

  • 정규 형식으로 표현된 정책의 비효율성으로 인해 광범위한 형식 게임에서 PSRO의 반복 복잡도가 지수적으로 증가하는 문제를 해결한다.
  • 모든 정보 상태에서 최적 반응을 혼합함으로써 광범위한 형식 정책에 직접 작용하는 더블 오라클 알고리즘을 개발한다.
  • 고차원 연속 행동 순차 게임에서 이전 딥 RL 방법이 넷쇼우 균형에 수렴하지 못하는 상황에서도 처리할 수 있는 신경망 확장인 NXDO를 설계한다.
  • CFR와 유사한 계산 비용으로도 XDO가 전략 지원이 희박한 게임에서 더 낮은 유용성(exploitability)을 달성함을 입증한다.
  • 이론적 및 실증적 보장 조건을 통해 XDO가 정보 상태 수에 대해 선형 시간 내에 수렴함을 확립하며, PSRO의 최악의 경우 지수적 행동과는 대조된다.

제안 방법

  • XDO는 순수 전략의 집합을 유지하고, 이 집합에 포함된 전략들에서만 행동을 사용하는 제한된 게임을 구성한다.
  • 각 반복 단계에서 제한된 게임은 광범위한 형식 솔버(예: CFR 또는 허구적 플레이)를 통해 해결되어 메타 넷쇼우 균형을 찾고, 미리 보지 않은 정보 상태에서는 임의의 행동으로 전체 게임으로 확장된다.
  • 모든 정보 상태에서 메타 넷쇼우 균형에 대한 최적 반응을 계산하여 인구 집단에 추가함으로써 게임 트리 전반에 걸쳐 국소 정책 개선을 보장한다.
  • PSRO가 루트에서만 전략을 혼합하는 데 반해, XDO는 모든 정보 상태에서 혼합을 허용함으로써 더 효율적이고 정확한 정책 표현을 가능하게 한다.
  • NXDO는 정확한 최적 반응 대신 딥 강화학습 정책 네트워크(예: PPO 또는 DDQN)를 사용하여 대규모 또는 연속 행동 게임에서 근사 최적 반응을 학습한다.
  • NXDO의 제한된 게임은 정책 집합에서 선택하는 메타 액션을 사용하며, NFSP와 같은 신경망 광범위한 형식 게임 솔버를 사용해 해결함으로써 정보 상태 간 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1광범위한 형식 게임을 위한 더블 오라클 알고리즘이 정보 상태 수에 대해 선형 시간 내에 수렴할 수 있는가? PSRO의 잠재적 지수적 복잡도와는 대비된다.
  • RQ2루트에서만이 아니라 모든 정보 상태에서 최적 반응을 혼합함으로써 대규모 게임에서 더 빠른 수렴과 더 낮은 유용성을 달성할 수 있는가?
  • RQ3이 알고리즘의 딥 강화학습 변형(NXDO)이 고차원 연속 행동 순차 게임에서 근사 넷쇼우 균형을 효과적으로 찾을 수 있는가?
  • RQ4수정된 Leduc 포커 및 연속 행동 게임에서 XDO가 PSRO와 CFR에 비해 유용성과 샘플 효율성 측면에서 어떻게 비교되는가?
  • RQ5NXDO에서 신경망을 사용함으로써 대규모 또는 연속 행동 공간을 가진 게임에서 일반화 능력과 성능 향상이 어느 정도 달성되는가?

주요 결과

  • Leduc 포커에서 XDO는 7회 이내에 0.1의 유용성을 달성하지만, PSRO는 유사한 수준에 도달하기 위해 150회 이상의 반복이 필요하다.
  • 2-Clone Leduc 포커에서는 XDO가 CFR+와 MCCFR보다 더 낮은 유용성을 보이며, 방문한 게임 상태 수가 훨씬 적다. 이는 불필요한 행동들을 잘 잘라내기 때문이다.
  • Oshi-Zumo에서 XDO는 SDO, CFR+, MCCFR를 모두 능가하여 다양한 게임 구조에 대한 강건성을 입증한다.
  • 2D 및 16D 연속 행동 손실 게임에서 NXDO는 PSRO와 NFSP를 모두 능가한다. PPO 기반 최적 반응 학습이 고차원 공간에서의 수렴을 가능하게 했다.
  • DDQN 기반 최적 반응을 사용한 NXDO는 20-Clone Leduc 포커에서 PSRO를 능가하지만, 내부 루프의 경험 비용이 더 높아서 표본 설정에서는 표본 설정에서의 성과 격차가 더 작다.
  • 결과적으로 XDO와 NXDO는 각 정보 상태에서 넷쇼우 균형이 오직 소수의 행동들만 혼합하는 게임에서 특히 효과적이며, 행동 수가 많아지면 성능이 급격히 떨어지는 CFR 및 NFSP와는 대비된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.