[논문 리뷰] Stochastic Impulse Control of Non-Markovian Processes
이 논문은 반사 후행 확률미분방정식(RBSDEs)과 Snell 추정량을 이용하여 비마코프 과정에 대한 최적의 스토크라스틱 임펄스 제어의 존재성을 확립한다. 이는 고전적 준변분부등식 방법의 한계를 극복한 것이다. 주요 기여는 일반 조건 하에서, 즉 랜덤 계수와 경로에 의존하는 보상 함수를 포함하여 수렴하는 근사화 방법을 구성함으로써 엄밀한 존재 증명을 제공하는 것이다.
We consider a class of stochastic impulse control problems of general stochastic processes i.e. not necessarily Markovian. Under fairly general conditions we establish existence of an optimal impulse control. We also prove existence of combined optimal stochastic and impulse control of a fairly general class of diffusions with random coefficients. Unlike, in the Markovian framework, we cannot apply quasi-variational inequalities techniques. We rather derive the main results using techniques involving reflected BSDEs and the Snell envelope.
연구 동기 및 목표
- 고전적 준변분부등식 방법이 실패하는 비마코프 설정에서 스토크라스틱 임펄스 제어의 존재 결과 부족 문제를 해결하기 위해.
- 랜덤 계수와 경로에 의존하는 보상 함수를 갖는 과정으로 최적 제어 이론을 확장하기 위해.
- 일반적인 적분 가능성 및 적응 가능성 조건 하에서 최적의 임펄스 제어 존재성을 확립하기 위해.
- Beneës 유형의 선택 정리에 의해 복합적인 확률적 및 임펄스 제어를 통합적으로 다루기 위해.
제안 방법
- 가치 과정은 보상 과정의 Snell 추정량으로 특성화되며, 이는 보상을 지배하는 가장 작은 초마르팅게일임을 보장한다.
- 반사 후행 확률미분방정식(RBSDEs)은 가치 과정을 표현하는 데 사용되며, 반사 부분은 임펄스 제어 비용을 나타낸다.
- 유한한 수의 임펄스를 갖는 제어를 사용하는 근사화 방법이 구성되며, 이들의 가치 과정은 진짜 가치 과정으로 수렴한다.
- 옵셔널 과정의 균일 적분 가능성 및 [D] 클래스 성질을 이용하여 근사 가치 과정의 수렴성을 증명한다.
- RBSDE 해의 유일성에 기반하여, 유한한 임펄스 전략에 대한 최적 제어의 극한으로서 최적 제어를 도출한다.
- 혼합된 확률적 및 임펄스 제어 설정에서 최적 정책을 구성하기 위해 Beneës 유형의 선택 정리를 적용한다.
실험 결과
연구 질문
- RQ1보상 함수가 과정의 전체 경로에 의존하는 비마코프 과정에 대해 최적의 스토크라스틱 임펄스 제어를 보장할 수 있는가?
- RQ2마코프 성질이 없는 경우 준변분부등식을 사용할 수 없으며, 만약 그렇다면 최적 제어의 존재를 보장하는 대안 프레임워크는 무엇인가?
- RQ3일반적인 임의의 제어 문제에서 가치 과정이 적절한 적분 가능성 조건 하에서 Snell 추정량으로 표현되고, 반사 BSDE의 해로 나타날 수 있는가?
- RQ4유한한 시간 범위 내에서 유한한 수의 임펄스를 갖는 제어 문제에서, 유한한 임펄스 전략에 대한 최적 제어 전략이 모든 허용 가능한 임펄스 수열에 대한 최적 전략으로 수렴하는가?
- RQ5랜덤 계수를 갖는 확산 과정에 대해 복합적인 최적 확률적 및 임펄스 제어를 어떻게 구성할 수 있는가?
주요 결과
- 임펄스 제어 문제의 가치 과정은 보상 과정의 Snell 추정량으로 나타나며, 이는 반사 BSDE의 해와 동치임을 보였다.
- 계수에 대한 온건한 적분 가능성 조건 하에서 반사 BSDE 시스템의 해가 존재하고 유일함이 보장된다.
- 임펄스 제어 문제의 가치 과정은 임펄스 수가 증가함에 따라 유한한 임펄스 전략과 연관된 가치 과정의 극한임을 보였다.
- 랜덤 계수와 경로에 의존하는 보상 함수를 갖는 일반적인 비마코프 과정에 대해 최적의 임펄스 제어 전략이 존재함을 보였다.
- 유한한 수의 임펄스를 갖는 전략에 대한 최적 제어의 수열의 극한으로서 최적 제어가 구성되며, 이는 기대값 수렴을 보장한다.
- 혼합된 확률적 및 임펄스 제어 설정에서 Beneës 유형의 선택 정리를 적용하여 최적 정책을 도출하였으며, 이는 더 넓은 범위의 확산 과정으로의 프레임워크 확장을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.