Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Set Values for Nonzero Sum Games with Multiple Equilibriums

Zachary Feinstein, Birgit Rudloff|arXiv (Cornell University)|2020. 02. 02.
Stochastic processes and financial applications참고 문헌 30인용 수 6
한 줄 요약

이 논문은 다수의 내쉬 균형을 가진 비제로 합 스토케스틱 미분 게임에 대해 동적 집합 가치를 도입하며, 이를 모든 균형 지급의 집합으로 정의한다. 닫힌 루프이자 경로에 의존하는 제어를 사용하여 동적 프로그래밍 원리(DPP)를 수립하고, 집합 가치가 경로에 의존하는 편미분방정식(PDE)를 만족함을 보여, 수치 계산이 가능하게 하며 정규성과 안정성을 보장한다.

ABSTRACT

Nonzero sum games typically have multiple Nash equilibriums (or no equilibrium), and unlike the zero sum case, they may have different values at different equilibriums. Instead of focusing on the existence of individual equilibriums, we study the set of values over all equilibriums, which we call the set value of the game. The set value is unique by nature and always exists (with possible value $\emptyset$). Similar to the standard value function in control literature, it enjoys many nice properties such as regularity, stability, and more importantly the dynamic programming principle. There are two main features in order to obtain the dynamic programming principle: (i) we must use closed-loop controls (instead of open-loop controls); (ii) we must allow for path dependent controls, even if the problem is in a state dependent (Markovian) setting. We shall consider both discrete and continuous time models with finite time horizon. For the latter we will also provide a duality approach through certain standard PDE (or path dependent PDE), which is quite efficient for numerically computing the set value of the game.

연구 동기 및 목표

  • 다수의 또는 존재하지 않는 내쉬 균형이 있는 비제로 합 스토케스틱 미분 게임에서 개별 균형이 서로 다른 지급을 낳을 수 있는 문제에 대응하기 위해.
  • 모든 균형 지급을 하나의 집합으로 통합하여 항상 존재하는(공집합일 수도 있음) 고유하고 잘 정의된 게임 가치를 정의하기 위해.
  • 이 집합 가치에 대해 동적 프로그래밍 원리(DPP)를 수립하여 이산 및 연속 시간 모델 모두에서 시간 일관성과 정규성을 보장하기 위해.
  • 오픈 루프 또는 상태에 의존하는 제어를 사용할 경우 DPP가 성립하지 않음을 보여, 마크로비안 설정에서도 경로에 의존하는 닫힌 루프 전략이 필수적임을 밝히기 위해.
  • 연속 시간 모델에서 다수의 균형이 존재할 경우 집합 가치를 효율적으로 수치적으로 계산하기 위한 이중성 접근법을 제공하기 위해.

제안 방법

  • 집합 가치는 모든 내쉬 균형에 대한 지급의 집합으로 정의되며, 구성에 의해 항상 존재하고 유일함을 보장한다.
  • 동적 프로그래밍 원리는 개방 루프 제어가 아닌, 상태와 시간에 의존하는 닫힌 루프 제어를 사용하여 수립된다.
  • 균형 가치의 유일성 부재로 인해, DPP가 성립하기 위해 경로에 의존하는 제어가 필요하며, 마크로비안 설정에서도 마찬가지다.
  • 연속 시간에서는 집합 가치가 비가역성 확산과 무한 제어를 갖는 경로에 의존하는 허문지-하미튼-재만 방정식(PPDE)의 점성해로 특징지어진다.
  • 상태에 의존하는 경우에 한해 표준 HJB 방정식으로 축소되는 경로에 의존하는 PDE(PPDE)를 사용한 이중성 접근법이 개발되었다.
  • 이 방법은 특히 다수의 균형이 존재할 경우 PPDE의 해를 통해 집합 가치의 수치 계산이 가능하게 한다.

실험 결과

연구 질문

  • RQ1다수의 내쉬 균형이 존재할 경우 비제로 합 스토케스틱 미분 게임에 대해 고유한 게임 가치를 정의할 수 있는가?
  • RQ2비제로 합 게임에서 균형 지급의 집합에 대해 동적 프로그래밍 원리가 성립하는 조건은 무엇인가?
  • RQ3왜 비제로 합 게임에서는 제어나 0-합 게임과 달리 닫힌 루프이자 경로에 의존하는 제어가 DPP가 성립하기 위해 필수적인가?
  • RQ4다수의 균형이 존재하는 연속 시간 모델에서 집합 가치를 어떻게 수치적으로 계산할 수 있는가?
  • RQ5집합 가치와 후행 스토케스틱 미분 방정식(BSDE) 또는 경로에 의존하는 PDE의 해 사이의 관계는 무엇인가?

주요 결과

  • 집합 가치는 항상 잘 정의되고 유일하며, 개별 균형이 존재하지 않거나 서로 다른 지급을 낳을 경우에도 마찬가지다.
  • DPP는 오직 닫힌 루프이자 경로에 의존하는 제어를 사용할 경우에만 집합 가치에 대해 성립하며, 오픈 루프 또는 상태에 의존하는 제어로는 성립하지 않는다.
  • 집합 가치는 경로에 의존하는 PDE(PPDE)를 만족하며, 이는 비가역성이고 제어가 무한함을 특징으로 하며, 식 (3.57)의 점성해로 특징지어진다.
  • 마크로비안(상태에 의존하는) 경우, PPDE는 식 (3.57)(ii)에서 보듯이 표준 HJB 방정식으로 축소된다.
  • PPDE는 특히 연속 시간 모델에서 집합 가치를 효율적으로 수치적으로 계산하기 위한 이중성 접근법을 제공한다.
  • BSDE와의 연결이 확립되었다: 적절한 조건 하에서 모든 균형 지급은 경로에 의존하는 계수를 갖는 다변수 BSDE의 해를 통해 구성될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.