Skip to main content
QUICK REVIEW

[논문 리뷰] Backward Reachability Approach to State-Constrained Stochastic Optimal Control Problems for Jump Diffusion Systems

Jun Moon|arXiv (Cornell University)|2020. 06. 10.
Advanced Mathematical Modeling in Engineering참고 문헌 40인용 수 5
한 줄 요약

이 논문은 점프 디퓨전 시스템에 대한 상태 제약이 있는 확률적 최적 제어 문제를 해결하기 위해 후행 가시성 접근법을 제안한다. 원래의 비연속가치함수를 연속적인 보조 가치함수의 영수준집합으로 재구성함으로써, 비유계 제어와 특이 레비 측도의 도전 과제를 극복하면서, 두 번째 차수 비선형 적분-편미분방정식(IPDE)에 대한 연속 볼록 해의 존재성과 유일성을 확립한다.

ABSTRACT

In this paper, we consider the stochastic optimal control problem for jump diffusion systems with state constraints. In general, the value function of such problems is a discontinuous viscosity solution of the Hamilton-Jacobi-Bellman (HJB) equation, since the regularity cannot be guaranteed at the boundary of the state constraint. By adapting approaches of \cite{Bokanowski_SICON_2016} and the stochastic target theory, we obtain an equivalent representation of the original value function as the backward reachable set. We then show that this backward reachable can be characterized by the zero-level set of the auxiliary value function for the unconstrained stochastic control problem, which includes two additional unbounded controls as a consequence of the martingale representation theorem. We prove that the auxiliary value function is a unique continuous viscosity solution of the associated HJB equation, which is the second-order nonlinear integro-partial differential equation (IPDE). Our paper provides an explicit way to characterize the original (possibly discontinuous) value function as a zero-level set of the continuous solution of the auxiliary HJB equation. The proof of the existence and uniqueness requires a new technique due to the unbounded control sets, and the presence of the singularity of the corresponding Lévy measure in the nonlocal operator of the HJB equation.

연구 동기 및 목표

  • 상태 제약이 있는 점프 디퓨전 시스템에 대한 확률적 최적 제어 문제에서 비연속 볼록 해의 문제를 다루기 위해.
  • 후행 가시 집합을 이용하여 원래 가치함수의 등가 표현을 개발하기 위해.
  • 비제약 HJB 방정식을 푸는 연속 보조 가치함수를 통해 원래 문제를 특성화하기 위해.
  • 비유계 제어 집합과 특이 레비 측도가 존재하는 상황에서도 보조 HJB 방정식의 연속 볼록 해의 존재성과 유일성을 증명하기 위해.
  • 원래의 (비연속일 수 있는) 가치함수를 연속 해의 영수준집합으로 회복하는 구축 가능한 방법을 제공하기 위해.

제안 방법

  • Bokanowski 등 (2016)의 스토크라스틱 타겟 이론과 후행 가시성 프레임워크를 상태 제약이 있는 점프 디퓨전 시스템에 적응하기 위해.
  • 마팅글의 표현 정리를 통해 두 개의 추가 비유계 제어 변수를 도입하여 상태 제약을 역학에 통합하기 위해.
  • 확장된 제어 공간 $\mathcal{A}_{t,T} \times \mathcal{B}_{t,T}$ 를 정의하여 상태 제약을 역학에 올리기 위한 보조 스토크라스틱 제어 문제를 정의하기 위해.
  • 점프 디퓨전으로 인한 비국소 연산으로 인해 두 번째 차수 비선형 적분-편미분방정식(IPDE)이 되는 관련 허밀토니안-자코비-벨만(HJB) 방정식을 제시하기 위해.
  • 원래의 제약 문제와 보조 가치함수 $W(t,a,b)$ 의 영수준집합 사이의 동치성을 확립하기 위해.
  • 적절한 경계 조건 하에서 $W$ 가 보조 HJB 방정식의 유일한 연속 볼록 해임을 증명하기 위해.

실험 결과

연구 질문

  • RQ1점프 디퓨전이 있는 상태 제약이 있는 확률적 최적 제어 문제는 어떻게 후행 가시 집합을 통해 등가로 표현될 수 있는가?
  • RQ2제약 문제의 비연속 가치함수는 비제약 보조 문제의 연속 해로부터 회복될 수 있는가?
  • RQ3비유계 제어와 특이 레비 측도가 존재할 경우 보조 가치함수를 지배하는 HJB 방정식의 구조는 어떠한가?
  • RQ4비유계 제어 집합과 레비 측도의 특이성이 존재하는 상황에서 볼록 해의 존재성과 유일성은 어떻게 확립할 수 있는가?
  • RQ5마팅글의 표현 정리는 어떻게 제어 공간을 확장하여 연속 보조 가치함수를 구성할 수 있도록 하는가?

주요 결과

  • 원래의 가치함수 $V(t,a)$ 는 $\mathcal{R}_t^\Gamma$ 가 후행 가시 집합일 때 $\inf\{b \geq 0 \mid (a,b) \in \mathcal{R}_t^\Gamma\}$ 로 등가로 표현된다.
  • 가치함수 $V(t,a)$ 는 연속 보조 가치함수 $W(t,a,b)$ 의 영수준집합으로 특성화되며, 즉 $V(t,a) = \inf\{b \geq 0 \mid W(t,a,b) = 0\}$ 이다.
  • $W$ 는 보조 HJB 방정식의 유일한 연속 볼록 해이며, 이는 두 번째 차수 비선형 적분-편미분방정식(IPDE)이다.
  • $W$ 의 존재성과 유일성 증명은 비유계 제어 집합과 비국소 연산의 레비 측도에서의 특이성에 특화된 새로운 기법에 의존한다.
  • 이 방법은 비연속 가치함수 문제를 연속 볼록 해 프레임워크로 성공적으로 변환하여, 강력한 수치적 및 분석적 처리를 가능하게 한다.
  • 이 접근법은 일반적인 상태 제약 $\Gamma$ 를 가진 점프 디퓨전 시스템에 대해 유효하며, 계수와 레비 측도에 대한 주어진 가정 하에서 해의 구조는 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.