Skip to main content
QUICK REVIEW

[논문 리뷰] Competing Against Equilibria in Zero-Sum Games with Evolving Payoffs

Adrian Rivera Cardoso, Jacob Abernethy|arXiv (Cornell University)|2019. 07. 17.
Game Theory and Applications참고 문헌 50인용 수 8
한 줄 요약

이 논문은 변화하는 수익 행렬을 가진 온라인 행렬 게임를 위한 새로운 알고리즘인 SP-RFTL을 소개한다. 여기서 플레이어들은 장기 평균 수익 행렬의 내쉬 균형(Nash Equilibrium, NE)에 대비하여 NE 회귀(regret)를 최소화하고자 한다. 이 알고리즘은 행동 수에 대해 다항로그형(logarithmic) 의존성과 라운드 수에 대해 선형 의존성을 가지며, 하위선형(sublinear) NE 회귀를 달성한다. 또한 GAN 학습에서 기존의 기준선들인 Unrolled GAN과 WGAN을 능가하는 강력한 성능을 보여준다.

ABSTRACT

We study the problem of repeated play in a zero-sum game in which the payoff matrix may change, in a possibly adversarial fashion, on each round; we call these Online Matrix Games. Finding the Nash Equilibrium (NE) of a two player zero-sum game is core to many problems in statistics, optimization, and economics, and for a fixed game matrix this can be easily reduced to solving a linear program. But when the payoff matrix evolves over time our goal is to find a sequential algorithm that can compete with, in a certain sense, the NE of the long-term-averaged payoff matrix. We design an algorithm with small NE regret--that is, we ensure that the long-term payoff of both players is close to minimax optimum in hindsight. Our algorithm achieves near-optimal dependence with respect to the number of rounds and depends poly-logarithmically on the number of available actions of the players. Additionally, we show that the naive reduction, where each player simply minimizes its own regret, fails to achieve the stated objective regardless of which algorithm is used. We also consider the so-called bandit setting, where the feedback is significantly limited, and we provide an algorithm with small NE regret using one-point estimates of each payoff matrix.

연구 동기 및 목표

  • 장기 수익이 평균 수익 행렬의 최소최대 최적해(minimax optimum)에 가까워지도록 보장하는 순차적 알고리즘을 설계한다.
  • 표준 회귀 최소화가 NE 회귀 제어를 달성하지 못하는 반복 제로섬 게임에서의 공격자에 의한 수익 행렬 변화 문제를 다룬다.
  • 행동 수에 대해 다항로그형 의존성과 라운드 수에 대해 선형 의존성을 가지며 하위선형 NE 회귀를 달성하는 알고리즘을 개발한다.
  • 일점 수익 추정을 사용하여 밴딧 피드백 설정으로 프레임워크를 확장한다.
  • GAN 학습에서의 접근 방식에 대한 실증적 검증을 통해 더 나은 모드 커버리지와 샘플 품질을 보여준다.

제안 방법

  • 고정 간격 동안 개별 회귀 최소화 알고리즘의 반복 값을 평균화하는 공동 전략 업데이트 규칙인 SP-RFTL(반모수적 정규화 Follow-the-Leader)을 제안한다.
  • 개별 수익 행렬이 공격적으로 변화하더라도 평균 수익 행렬의 내쉬 균형(Nash Equilibrium)으로 수렴하도록 보장하기 위해 정규화 프레임워크를 사용한다.
  • 밴딧 설정에서는 전체 피드백을 근사하기 위해 수익 행렬의 일점 추정치를 사용하여 정보가 제한된 환경에서도 NE 회귀 최소화를 가능하게 한다.
  • 미니배치를 사용하여 생성자와 판별기 손실을 근사하고 고정 간격 동안 반복 값을 평균화함으로써 알고리즘을 GAN 학습에 적용한다.
  • 온라인 볼록 최적화(OCO) 원리와 이중 평균 접근법을 사용하여 전체 피드백 및 밴딧 피드백 모두에서 낮은 회귀를 유지한다.
  • 단순한 개별 회귀 최소화가 하위선형 NE 회귀를 달성하지 못함을 증명하여 공동 전략 설계의 必요성(necessity)을 입증한다.

실험 결과

연구 질문

  • RQ1변화하는 수익 행렬을 가진 온라인 제로섬 게임에서 공동 전략이 하위선형 내쉬 균형 회귀를 달성할 수 있는가?
  • RQ2왜 표준 개별 회귀 최소화가 이 설정에서 NE 회귀 제어를 보장하지 못하는가?
  • RQ3단지 일점 수익 추정치만을 사용하는 밴딧 피드백 하에서 하위선형 NE 회귀를 달성할 수 있는가?
  • RQ4제안된 알고리즘이 기존의 GAN 학습 방법에 비해 모드 커버리지와 샘플 품질 측면에서 어떻게 비교되는가?
  • RQ5비정상적인 설정에서 평균 수익 행렬의 내쉬 균형에 대비하여 온라인 학습 알고리즘을 원칙적으로 어떻게 적응시킬 수 있는가?

주요 결과

  • SP-RFTL는 행동 수에 대해 다항로그형 의존성과 라운드 수에 대해 선형 의존성을 가지며 하위선형 NE 회귀를 달성하며, 로그 인자까지 최적의 경계에 근접한다.
  • 8개의 가우시안 혼합 분포를 학습할 때, Unrolled GAN과 WGAN에 비해 유의미하게 뛰어난 성능을 보이며, 진정한 분포를 더 빨리 학습하고 모드 붕괴를 방지한다.
  • 어떤 기초 알고리즘을 사용하든 간에 단순한 개별 회귀 최소화는 하위선형 NE 회귀를 달성하지 못함을 입증하여 공동 전략 설계의 必요성(necessity)을 증명한다.
  • SP-RFTL의 밴딧 버전은 단지 일점 수익 추정치만을 사용하여 하위선형 NE 회귀를 달성하며, 정보가 제한된 환경에의 적용 가능성을 보여준다.
  • 실증 결과로, 고정 간격마다 반복 값을 평균화하는 것이 SP-RFTL의 핵심 요소임을 입증하며, 이는 모드 붕괴를 방지하고 GAN 학습의 안정성을 향상시킨다.
  • 알고리즘은 공격자에 의한 수익 행렬 시퀀스에 대해 강건하며, 라운드 간에 수익 행렬이 임의로 변화하더라도 낮은 회귀를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.