[논문 리뷰] Dynamic Programming Principles for Optimal Stopping with Expectation Constraint
이 논문은 누적 비용에 대한 기대치 제약 조건이 있는 최적 정지 문제에 대해 동적 프로그래밍 원리(DPP)를 수립하며, 가치 함수의 연속성을 증명하고, 완전 비선형 포물형 해밀턴-자코비-벨리만(HJB) 방정식의 점성 해로 특성화한다. 주요 혁신은 조건부 기대 비용을 추가 상태 과정으로 도입함으로써, 제약 조건이 있는 최적 정지 문제에서 열린 문제를 해결하는 DPP를 가능하게 한다.
We analyze an optimal stopping problem with a constraint on the expected cost. When the reward function and cost function are Lipschitz continuous in state variable, we show that the value of such an optimal stopping problem is a continuous function in current state and in budget level. Then we derive a dynamic programming principle (DPP) for the value function in which the conditional expected cost acts as an additional state process. As the optimal stopping problem with expectation constraint can be transformed to a stochastic optimization problem with supermartingale controls, we explore a second DPP of the value function and thus resolve an open question recently raised in [S. Ankirchner, M. Klein, and T. Kruse, A verification theorem for optimal stopping problems with expectation constraints, Appl. Math. Optim., 2017, pp. 1-33]. Based on these two DPPs, we characterize the value function as a viscosity solution to the related fully non-linear parabolic Hamilton-Jacobi-Bellman equation.
연구 동기 및 목표
- 누적 비용에 대한 기대치 제약 조건이 있는 최적 정지 문제에서 동적 프로그래밍 원리의 부재를 해결하기 위해.
- 리프시츠 연속성과 비퇴화 조건 하에서 상태 변수와 예산 변수에 대한 가치 함수의 연속성을 확립하기 위해.
- 제약 조건이 있는 최적 정지 문제에 대한 DPP에 대한 열린 문제를 해결하기 위해, 조건부 기대 비용을 보조 상태 과정으로 도입함으로써.
- 값 함수를 완전 비선형 포물형 HJB 방정식의 점성 해로 특성화하기 위해.
- 제약 조건이 있는 최적 정지 문제를 초과마팅갈레 제어를 갖는 확률적 제어 문제로 변환하여, 두 번째 DPP를 도출하기 위해.
제안 방법
- 조건부 기대 비용을 추가 상태 과정으로 간주하여, 이동된 확률적 미분 방정식과 흐름 성질을 활용해 DPP를 유도한다.
- 사전 추정과 근사 정지 전략을 활용하여 (t, x, y)에서의 가치 함수의 연속성을 증명한다.
- 조건부 확률 분포와 상태 과정의 마코프 성질을 활용하여 DPP의 '≤' 방향을 확립한다.
- 지역 정지 규칙을 붙임으로써 ε-최적 전략을 구성하고, 가치 함수의 연속성을 활용하여 DPP의 '≥' 방향을 증명한다.
- 예산 수준 y에서 시작하는 초과마팅갈레 제어를 갖는 비제약 확률적 제어 문제로 제약 조건이 있는 최적 정지 문제를 변환한다.
- 값 함수를 완전 비선형 포물형 HJB 방정식의 점성 해로 특성화하며, 몽제-암페르 형식의 구조를 포함한다.
실험 결과
연구 질문
- RQ1누적 비용에 대한 기대치 제약 조건이 있는 최적 정지 문제에 대해 동적 프로그래밍 원리를 수립할 수 있는가?
- RQ2리프시츠 연속성과 비퇴화 조건 하에서 상태 변수와 예산 수준에 대해 가치 함수는 연속적인가?
- RQ3조건부 기대 비용을 어떻게 상태 과정으로 통합하여 이 제약 조건 하에서 DPP를 가능하게 할 수 있는가?
- RQ4제약 조건이 있는 문제를 초과마팅갈레 제어를 갖는 확률적 제어 문제로 재구성하여 두 번째 DPP를 도출할 수 있는가?
- RQ5값 함수는 완전 비선형 포물형 해밀턴-자코비-벨리만 방정식의 점성 해인가?
주요 결과
- f, π, g의 리프시츠 연속성과 g의 비퇴화 조건 하에서, 가치 함수 V(t, x, y)는 (t, x, y)에서 연속이다.
- 조건부 기대 비용 Y^{t,x,τ}_s 가 추가 상태 과정으로 작용하는 DPP가 수립되며, 다음과 같은 형태를 가진다: V(t,x,y) = sup_E[1_{τ≤ζ(τ)} R(t,x,τ) + 1_{τ>ζ(τ)} (V(ζ(τ), X^{t,x}_{ζ(τ)}, Y^{t,x,τ}_{ζ(τ)}) + ∫_t^{ζ(τ)} f(r,X^{t,x}_r) dr)].
- 값 함수는 몽제-암페르 형식의 구조를 포함하는 완전 비선형 포물형 해밀턴-자코비-벨리만 방정식의 점성 해로 특성화된다.
- 제약 조건이 있는 문제를 초과마팅갈레 제어를 갖는 비제약 확률적 제어 문제로 변환함으로써 두 번째 DPP가 도출되었으며, 이는 [Ankirchner 등, 2017]에서 제기된 열린 문제를 해결한다.
- V의 연속성 덕분에, 붙임을 통한 ε-최적 정지 전략을 구성할 수 있으며, 이는 DPP의 역부등식을 증명하는 데 핵심적이다.
- 값 함수는 유한하고 가측적이며, E_t[K_*] < ∞ 임을 보여주어 동적 프로그래밍 프레임워크의 타당성을 확보한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.