Skip to main content
QUICK REVIEW

[논문 리뷰] A Computationally Efficient Implementation of Fictitious Play for Large-Scale Games

Brian Swenson, Soummya Kar|arXiv (Cornell University)|2015. 06. 13.
Game Theory and Applications참고 문헌 19인용 수 7
한 줄 요약

이 논문은 계산적으로 효율적인 샘플링된 허구적 플레이(CESFP)를 제안한다. 이는 샘플링된 허구적 플레이(Sampled FP)의 한계를 해결하기 위해, 매 라운드에 단 한 개의 샘플만을 사용하면서도 거의 확실한 나시 균형에 수렴하는, 확률적 근사 업데이트 규칙을 사용하는 허구적 플레이의 변종이다. 이로 인해 대규모 게임에서 기존의 샘플링된 FP보다 상당한 계산적 절감을 이룬다. 기존 샘플링된 FP는 매 라운드에 O(√t)개의 샘플이 필요하기 때문이다.

ABSTRACT

The paper is concerned with distributed learning and optimization in large-scale settings. The well-known Fictitious Play (FP) algorithm has been shown to achieve Nash equilibrium learning in certain classes of multi-agent games. However, FP can be computationally difficult to implement when the number of players is large. Sampled FP is a variant of FP that mitigates the computational difficulties arising in FP by using a Monte-Carlo (i.e., sampling-based) approach. The Sampled FP algorithm has been studied both as a tool for distributed learning and as an optimization heuristic for large-scale problems. Despite its computational advantages, a shortcoming of Sampled FP is that the number of samples that must be drawn in each round of the algorithm grows without bound (on the order of $\sqrt{t}$, where $t$ is the round of the repeated play). In this paper we propose Computationally Efficient Sampled FP (CESFP)---a variant of Sampled FP in which only one sample need be drawn each round of the algorithm (a substantial reduction from $O(\sqrt{t})$ samples per round, as required in Sampled FP). CESFP operates using a stochastic-approximation type rule to estimate the expected utility from round to round. It is proven that the CESFP algorithm achieves Nash equilibrium learning in the same sense as classical FP and Sampled FP. Simulation results suggest that the convergence rate of CESFP (in terms of repeated-play iterations) is similar to that of Sampled FP.

연구 동기 및 목표

  • 많은 플레이어가 있는 대규모 다중 에이전트 게임에서 허구적 플레이의 높은 계산 비용을 해결하기 위해.
  • 샘플링된 허구적 플레이가 수렴을 보장하기 위해 매 라운드에 O(√t)개의 샘플이 필요하여 대규모 환경에서는 실용적이지 않다는 한계를 극복하기 위해.
  • 수렴성은 유지하면서도 매 라운드의 샘플링 복잡도를 극적으로 줄인 샘플링된 FP의 변종을 개발하기 위해.
  • 고차원 전략 단체에서 기대 유용도를 직접 계산하지 않기 때문에, 대규모 게임에서 확장 가능하고 분산된 학습을 가능하게 하기 위해.
  • 최적화, 라우팅, 제어 분야의 응용 분야에서 전통적이고 샘플링된 FP의 실용적이고 계산적으로 효율적인 대안을 제공하기 위해.

제안 방법

  • CESFP는 기대 유용도를 추정하기 위해 확률적 근사 유형의 재귀적 업데이트 규칙을 사용하며, 이는 이전 샘플 데이터와 현재 샘플 데이터를 모두 통합하여 이전 샘플을 기각하지 않는다.
  • 알고리즘은 매 라운드에 단 한 개의 샘플만 추출하므로, 샘플링된 FP의 O(√t)개의 샘플 대비 상당한 반복 계산 비용 절감이 가능하다.
  • 기대 유용도는 가중 평균을 통해 추정된다: μ̂_t = (1−ρ_t)μ̂_{t−1} + ρ_t X_t, 여기서 ρ_t는 점점 감소하는 단계 크기이다.
  • 수렴성은 CESFP가 일반화된 약화된 허구적 플레이 과정임을 보여줌으로써 증명되며, [20]에서 제시된 균형 학습 결과를 활용한다.
  • 고차원 기대 유용도의 명시적 평가를 피하기 위해, 재귀적으로 업데이트되는 샘플된 유용도 근사치에 의존한다.
  • 수렴을 보장하기 위해 ∑ρ_t = ∞ 이고 ∑ρ_t² < ∞ 를 만족하는 감소하는 단계 크기 ρ_t 를 사용한다.

실험 결과

연구 질문

  • RQ1매 라운드에 단 한 개의 샘플만 요구하면서도 나시 균형에 거의 확실하게 수렴하는 허구적 플레이의 변종을 설계할 수 있는가?
  • RQ2샘플링된 FP에서 매 라운드의 샘플링 수를 O(√t)에서 1로 줄여도 균형에 거의 확실하게 수렴하는가?
  • RQ3확률적 근사 기반의 재귀적 추정 규칙이 기존 샘플링된 FP에서 요구하는 전체 샘플링을 효과적으로 대체할 수 있는가?
  • RQ4반복 플레이 반복 수 측면에서 제안된 방법의 수렴 속도는 샘플링된 FP와 비교해 어떻게 되는가?
  • RQ5어떤 대규모 게임 환경에서 이 방법을 보장된 수렴성과 함께 실용적으로 적용할 수 있는가?

주요 결과

  • CESFP는 거의 확실하게 나시 균형 집합으로 수렴하며, 기존의 허구적 플레이와 샘플링된 FP의 수렴 보장을 그대로 유지한다.
  • 알고리즘은 매 라운드에 단 한 개의 샘플만 필요하므로, 샘플링된 FP 대비 반복 계산 비용이 O(√t)에서 O(1)로 감소한다.
  • 시뮬레이션 결과는 CESFP가 반복 플레이 반복 수 측면에서 샘플링된 FP와 유사한 수렴 속도를 보임을 보여준다.
  • 일반화된 약화된 허구적 플레이와의 연결을 통해 수렴성이 증명되었으며, 이는 이론적 타당성을 확보한다.
  • 낮은 매 라운드 샘플링 오버헤드 덕분에, 이 방법은 대규모 최적화, 교통 라우팅, 인지 라디오, 마르코프 결정 과정 등 다양한 분야에 적용 가능하다.
  • 재귀적 추정 규칙은 단계 크기 수열에 대한 약한 조건 하에 추정 오차가 거의 확실하게 0으로 수렴함을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.