Skip to main content
QUICK REVIEW

[논문 리뷰] On Zero-Sum Stochastic Differential Games

Erhan Bayraktar, Song Yao|arXiv (Cornell University)|2011. 12. 24.
Stochastic processes and financial applications참고 문헌 4인용 수 9
한 줄 요약

이 논문은 이산 근사 대신 커버링 추론을 사용하여 유계 제곱-integrable 제어를 갖는 0-합 스토크라스틱 미분 게임에 대한 동적 프ogramming 원리를 수립하고, 수상가를 제2의 이중으로 반사된 후행 확률 미분 방정식(DRBSDE)을 통해 정의한다. 핵심 기여는 장애물이 있는 완전 비선형 PDE의 점성해로서 가치 함수의 존재성과 유일성을 증명한 것으로, 이는 이전 연구에서 필요로 했던 컴팩트 제어 공간의 가정을 확장한 것이다.

ABSTRACT

We generalize the results of Fleming and Souganidis (1989) on zero sum stochastic differential games to the case when the controls are unbounded. We do this by proving a dynamic programming principle using a covering argument instead of relying on a discrete approximation (which is used along with a comparison principle by Fleming and Souganidis). Also, in contrast with Fleming and Souganidis, we define our pay-off through a doubly reflected backward stochastic differential equation. The value function (in the degenerate case of a single controller) is closely related to the second order doubly reflected BSDEs.

연구 동기 및 목표

  • 0-합 스토크라스틱 미분 게임에 대한 Fleming과 Souganidis의 결과를 비유계 제어로 일반화하기 위해.
  • 이전 연구에서 사용된 이산 근사 방법을 대체하기 위해 커버링 추론을 사용하여 동적 프로그래밍 원리를 증명하기 위해.
  • 제어가 제곱-integrable이고 컴팩트 지지가 아니더라도 일관되게 정의될 수 있도록 게임의 수상가를 제2의 이중 반사된 후행 확률 미분 방정식(DRBSDE)을 통해 정의하기 위해.
  • 장애물 제약 조건이 있는 완전 비선형 PDE의 점성해로서 가치 함수를 정의하기 위해.
  • 스토크라스틱 미분 게임 이론의 적용 가능성을 기존의 컴팩트 제어 공간을 초월한 더 넓고 현실적인 제어 설정으로 확장하기 위해.

제안 방법

  • 이전 연구에서 사용된 이산 근사 방법에 의존하지 않고, 커버링 추론을 사용하여 동적 프로그래밍 원리를 증명한다.
  • 게임의 종료 보상과 제약 조건을 모델링하기 위해 제2의 이중 반사된 후행 확률 미분 방정식(DRBSDE)을 통해 수상가를 정의한다.
  • 확률 측도 하에서 가측성과 적분 가능성 보장을 위해, 이동된 과정과 제어의 붙임 기법을 적용하여 확률적 제어 경로를 다룬다.
  • 정규 조건부 확률 분포와 표준 확률 공간을 사용하여 임의의 시작 시간 t ∈ [0, T]에서 게임 역학을 모델링한다.
  • 점성해 이론을 활용하여 장애물이 있는 완전 비선형 PDE의 유일한 해로서 가치 함수를 특성화한다.
  • Girsanov 정리와 마틴갈 표현을 활용하여 측도 변화 하에서 가치 함수와 DRBSDE 해 간의 등가성을 확립한다.

실험 결과

연구 질문

  • RQ1이산 근사에 의존하지 않고, 비유계 제어를 갖는 0-합 스토크라스틱 미분 게임에 대해 동적 프로그래밍 원리를 수립할 수 있는가?
  • RQ2제어가 제곱-integrable이지만 컴팩트 지지가 아니면, 이러한 게임에서 수상가를 어떻게 일관되게 정의할 수 있는가?
  • RQ3비유계 제어를 갖는 0-합 게임의 가치 함수와 제2의 이중 반사된 후행 확률 미분 방정식(DRBSDE) 사이의 관계는 무엇인가?
  • RQ4단일 제어자가 존재하는 경우의 열화된 케이스에서, 가치 함수는 장애물 제약 조건이 있는 완전 비선형 PDE의 점성해인가?
  • RQ5이동된 과정과 제어의 붙임 기법은 확률적 제어 프레임워크에서 가측성과 적분 가능성을 어떻게 유지하는가?

주요 결과

  • 비유계 제곱-integrable 제어를 갖는 0-합 스토크라스틱 미분 게임에 대해, 이산 근사 대신 커버링 추론을 사용하여 동적 프로그래밍 원리가 성립함을 입증하였다.
  • 장애물이 있는 완전 비선형 PDE의 점성해로서 가치 함수가 존재하고 유일함을 입증하였으며, 이는 고전적 결과를 비유계 제어로 확장한 것이다.
  • 수상가는 제2의 이중 반사된 후행 확률 미분 방정식(DRBSDE)을 통해 엄밀하게 정의되었으며, 이는 게임의 종료 보상과 경로 기반 제약 조건을 포괄한다.
  • DRBSDE의 해는 게임의 가치 함수와 등가이며, 이 등가성은 측도 변화와 시간 이동 하에서도 유지된다.
  • 본 논문은 가치 함수가 제어의 붙임에 대해 안정적임을 입증하였으며, 이는 스토크라스틱 제어에서 동적 프로그래밍에 핵심적인 성질이다.
  • 분석을 통해 가치 함수가 브라운 운동과 제어 과정이 생성하는 필터레이션에 대해 가측적이며 점진적으로 가측적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.