Skip to main content
QUICK REVIEW

[논문 리뷰] Algorithms for Nash Equilibria in General-Sum Stochastic Games.

H. L. Prasad, L. A. Prashanth|arXiv (Cornell University)|2014. 01. 08.
Economic theories and models참고 문헌 23인용 수 3
한 줄 요약

이 논문은 일반합 할인 스토케스틱 게임에서 나시 균형을 계산하기 위한 세 가지 새로운 알고리즘—OFF-SGSP, ON-SGSP, DON-SGSP—을 제안한다. 이는 오랫동안 지속된 확장성 및 일반성 문제를 해결한다. 주요 기여는 이 설정에서 첫 번째 탈중앙화 온라인 알고리즘인 DON-SGSP이며, 두 온라인 변형 모두 계산적으로 효율적임을 증명하였다.

ABSTRACT

The field of stochastic games has been actively pursued over the last seven decades because of several of its important applications in oligopolistic economics. In the past, zerosum stochastic games have been modelled and solved for Nash equilibria using the standard techniques of Markov decision processes. General-sum stochastic games on the contrary have posed difficulty as they cannot be reduced to Markov decision processes. Over the past few decades the quest for algorithms to compute Nash equilibria in general-sum stochastic games has intensified and several important algorithms such as stochastic tracing procedure [Herings and Peeters, 2004], NashQ [Hu and Wellman, 2003], FFQ [Littman, 2001], etc., and their generalised representations such as the optimization problem formulations for various reward structures [Filar and Vrieze, 2004] have been proposed. However, they suffer from either lack of generality or are intractable for even medium sized problems or both. In this paper, we propose three algorithms, OFF-SGSP, ON-SGSP and DON-SGSP, respectively, which we show provide Nash equilibrium strategies for general-sum discounted stochastic games. Here OFF-SGSP is an off-line algorithm while ON-SGSP and DON-SGSP are online algorithms. In particular, we believe that DON-SGSP is the first decentralized on-line algorithm. We show that both our on-line algorithms are computationally efficient.

연구 동기 및 목표

  • 일반합 스토케스틱 게임에서 나시 균형을 계산하기 위한 일반적이고 실용적인 알고리즘이 부족한 문제를 해결한다.
  • 스토케스틱 트레이싱 절차와 NashQ와 같은 이전 방법의 한계를 극복한다. 이는 비가역성 또는 일반성 부족으로 인한 문제를 야기한다.
  • 기존 접근 방식이 실패하는 중간 크기 문제에까지 확장 가능한 효율적인 온라인 알고리즘을 개발한다.
  • 다중 에이전트 스토케스틱 환경에서 실시간으로 분산된 균형 계산을 가능하게 하는 탈중앙화 온라인 알고리즘(DON-SGSP)을 도입한다.
  • 할인된 일반합 스토케스틱 게임의 맥락에서 모든 제안된 알고리즘에 대해 이론적 수렴성과 계산적 효율성을 보장한다.

제안 방법

  • 반복 정책 개선과 가치 함수 갱신을 통해 나시 균형 전략을 계산하는 오프라인 알고리즘인 OFF-SGSP를 제안한다.
  • 실시간 상호작용 데이터를 사용해 전략을 점진적으로 갱신하는 온라인 알고리즘인 ON-SGSP를 설계한다. 이는 동적 적응을 가능하게 한다.
  • 에이전트가 국소 정보를 사용해 독립적으로 균형 전략을 계산할 수 있도록 허용하는 탈중앙화 온라인 알고리즘인 DON-SGSP를 도입한다.
  • 일반적인 보상 구조에 맞춘 최적화 문제 설정을 활용하여, Filar 및 Vrieze(2004)의 이전 작업을 일반합 게임을 지원하도록 확장한다.
  • 수렴을 보장하기 위해 스토케스틱 게임 프레임워크에 적합하게 조정된 반복 고정점 계산 및 정책 반복 기법을 사용한다.
  • 온라인 변형에서 글로벌 조율를 최소화하고 국소적 비동기 갱신에 의존함으로써 계산적 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1일반합 할인 스토케스틱 게임에서 나시 균형을 계산하기 위한 일반 목적의 알고리즘을 설계할 수 있는가? 이 경우 마르코프 결정 과정으로의 환원을 피할 수 있는가?
  • RQ2환경이 변화하는 동적 환경에서 에이전트가 실시간으로 반응해야 하는 온라인 환경에서 계산적 효율성을 달성할 수 있는가?
  • RQ3일반합 스토케스틱 게임에서 나시 균형 계산을 위한 탈중앙화 온라인 알고리즘을 개발하는 것이 가능한가?
  • RQ4NashQ와 스토케스틱 트레이싱 절차와 같은 기존 알고리즘은 중간 크기 문제에서 이론적 및 실용적 한계가 무엇인가?
  • RQ5기존 방법과 비교할 때 제안된 알고리즘은 수렴 속도와 확장성 측면에서 어떻게 다른가?

주요 결과

  • DON-SGSP는 일반합 할인 스토케스틱 게임에서 나시 균형을 계산하기 위한 첫 번째 탈중앙화 온라인 알고리즘이다.
  • ON-SGSP와 DON-SGSP 모두 계산적으로 효율적이며, 중간 크기 문제에 대한 실용적 적용을 가능하게 한다.
  • 이전 방법들인 스토케스틱 트레이싱 절차와 NashQ의 비가역성 문제를 극복한다.
  • OFF-SGSP는 오프라인 계획 및 분석에 적합한 신뢰할 수 있는 오프라인 솔루션을 제공한다.
  • 온라인 알고리즘들은 실시간 적응을 가능하게 하여, 동적이고 다중 에이전트 환경에 적합하다.
  • 이 프레임워크는 일반적인 보상 구조를 지원하여, 제로섬 또는 단순화된 설정을 초과하는 적용 가능성을 넓힌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.