Skip to main content
QUICK REVIEW

[논문 리뷰] Online Double Oracle

Le Cong Dinh, Yaodong Yang|arXiv (Cornell University)|2021. 03. 13.
Advanced Bandit Algorithms Research참고 문헌 3인용 수 4
한 줄 요약

이 논문은 대규모 이인제로-합계 정규형 게임을 해결하기 위해 온라인 학습과 더블 오라클 기법을 융합한 새로운 알고리즘인 온라인 더블 오라클(ODO)을 제안한다. 무회귀 학습과 동적 전략 풀 확장을 활용함으로써, ODO는 $\mathcal{O}(\sqrt{Tk\log(k)})$의 회귀 한계를 달성한다. 여기서 $k$는 전체 행동 공간이 아닌 나시 균형의 지지 크기에 따라 결정되며, 이는 효율적인 수렴과 적대자에 대한 전략적 이용을 가능하게 하여, 수렴 속도와 수익 측면에서 DO, PSRO, MWU를 모두 능가한다.

ABSTRACT

Solving strategic games with huge action space is a critical yet under-explored topic in economics, operations research and artificial intelligence. This paper proposes new learning algorithms for solving two-player zero-sum normal-form games where the number of pure strategies is prohibitively large. Specifically, we combine no-regret analysis from online learning with Double Oracle (DO) methods from game theory. Our method -- \emph{Online Double Oracle (ODO)} -- is provably convergent to a Nash equilibrium (NE). Most importantly, unlike normal DO methods, ODO is \emph{rationale} in the sense that each agent in ODO can exploit strategic adversary with a regret bound of $\mathcal{O}(\sqrt{T k \log(k)})$ where $k$ is not the total number of pure strategies, but rather the size of \emph{effective strategy set} that is linearly dependent on the support size of the NE. On tens of different real-world games, ODO outperforms DO, PSRO methods, and no-regret algorithms such as Multiplicative Weight Update by a significant margin, both in terms of convergence rate to a NE and average payoff against strategic adversaries.

연구 동기 및 목표

  • 행위 공간이 매우 큰 두 명의 플레이어가 참여하는 0-합 정규형 게임을 해결하는 데 도전하는 것.
  • 전체 게임 크기에 의존하지 않으면서도 합리성(무회귀)을 유지하는 확장 가능한 알고리즘을 개발하는 것.
  • 伝통적인 더블 오라클 방법과 달리, 게임 중 적대자에 대한 전략적 이용을 가능하게 하는 것.
  • 나시 균형에 더 빠르게 수렴하고 전략적 상대방에 대해 더 높은 평균 수익을 달성하는 것.
  • 전체 게임 행렬 지식에 대한 의존도를 줄이고, 비용이 많이 드는 최적 대응 오라클 호출을 최소화하는 것.

제안 방법

  • ODO는 무회귀 온라인 학습을 더블 오라클 프레임워크와 통합하여, 고정된 최적 대응 오라클 대신 회귀를 최소화하는 전략을 사용한다.
  • 각 반복 단계에서 알고리즘은 전략 풀을 사용하여 $\epsilon$-최적 대응을 계산한 후, 이를 플레이어의 활성 전략 집합에 추가한다.
  • 회귀 한계는 온라인 학습 분석을 통해 유도되며, 이는 나시 균형의 지지 크기인 $k$에 따라 스케일링되며, 순수 전략의 총 수인 $n$이 아니라 $k$에 따라 결정된다.
  • ODO는 점진적으로 증가하는 동적 전략 풀을 사용하여, 약한 가정 하에 나시 균형으로의 수렴을 보장한다.
  • 전체 게임 행렬에 대한 액세스를 피하고, 하위 게임에서 최적 대응을 위한 오라클 쿼리에만 의존한다.
  • 자기 플레이 및 상대방 이용 설정을 모두 지원하며, 성능 평가에는 유의미성과 평균 수익 지표를 사용한다.

실험 결과

연구 질문

  • RQ1더블 오라클 스타일 알고리즘이 대규모 행동 공간을 가진 0-합 게임에서 무회귀 학습을 달성할 수 있는가?
  • RQ2ODO의 회귀 한계가 전체 행동 공간이 아닌 나시 균형의 지지 크기에 따라 스케일링되는가?
  • RQ3ODO는 MWU 및 DO와 같은 표준 무회귀 알고리즘보다 전략적 상대방에 대해 수렴 속도와 수익 측면에서 뛰어나게 성능을 내는가?
  • RQ4복잡한 전략적 구조를 가진 실제 게임, 예를 들어 포커 변형에서 ODO는 어떻게 성능을 내는가?
  • RQ5전통적인 보수적인 DO나 PSRO와 달리, ODO는 무리성 또는 제한된 상대방을 능동적으로 이용할 수 있는가?

주요 결과

  • ODO는 나시 균형의 지지 크기인 $k$에 따라 결정되는 $\mathcal{O}(\sqrt{Tk\log(k)})$의 회귀 한계를 달성한다. 이는 순수 전략의 총 수가 아닌 $k$에 의존한다.
  • 15개의 실제 0-합 게임에서 ODO는 MWU, FP, DO, PSRO보다 나시 균형에 훨씬 더 빠르게 수렴한다.
  • MWU 상대방과의 대결에서 ODO는 MWU와 PSRO보다 더 높은 평균 수익을 달성하여 능동적인 이용 능력을 입증한다.
  • Leduc 포커와 Kuhn 포커에서 ODO는 모든 DO 및 PSRO 기반 모델보다 낮은 유의미성을 보였으며, CFR에 거의 근접한 성능을 내며 더 적은 최적 대응 오라클 호출을 사용했다.
  • 제한된 상대방 설정에서 ODO는 빠르게 양의 기대 수익을 확보하는 반면, PSRO는 일정 수준에 머물러 있어, ODO의 이용 우월성을 확인한다.
  • ODO의 최적 대응 오라클 호출 수는 PSRO보다 상당히 적으며, CFR와 같은 최첨단 솔버와 유사한 수준이지만, 더 뛰어난 수렴 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.