Skip to main content
QUICK REVIEW

[논문 리뷰] A deep learning method for solving stochastic optimal control problems driven by fully-coupled FBSDEs

Shaolin Ji, Shigē Péng|arXiv (Cornell University)|2022. 04. 12.
Energy, Environment, and Transportation Policies인용 수 4
한 줄 요약

이 논문은 완전히 결합된 정방향-역방향 확률미분방정식(FBSDEs)에 의해 구동되는 고차원 스토크라스틱 최적제어 문제를 해결하기 위한 딥러닝 방법을 제안한다. 교차 최적화(CO) 프레임워크를 기반으로 하며, 문제를 스토크라스틱 스택엘베르그 미분게임으로 재구성함으로써, 딥 네ural 네트워크를 사용하여 리더의 제어와 팔로워의 상태 변수를 번갈아 최적화함으로써, 재귀적 유틸리티 모델을 사용한 두 가지 투자-소비 예제에서 정확한 해를 도출한다.

ABSTRACT

In this paper,we mainly focus on the numerical solution of high-dimensional stochastic optimal control problem driven by fully-coupled forward-backward stochastic differential equations (FBSDEs in short) through deep learning. We first transform the problem into a stochastic Stackelberg differential game problem (leader-follower problem), then a bi-level optimization method is developed where the leader's cost functional and the follower's cost functional are optimized alternatively via deep neural networks. As for the numerical results, we compute two examples of the investment-consumption problem solved through stochastic recursive utility models, and the results of both examples demonstrate the effectiveness of our proposed algorithm.

연구 동기 및 목표

  • 완전히 결합된 FBSDEs에 의해 지배되는 고차원 스토크라스틱 최적제어 문제에 대한 수치적 방법의 부족을 해결하기 위해.
  • 기존의 PDE 또는 확률적 방법을 사용할 경우 고차원 FBSDEs를 해결하는 데 발생하는 계산적 어려움을 극복하기 위해.
  • FBSDEs의 정방향 및 역방향 동역학이 결합된 상황을 다룰 수 있는 확장 가능한 딥러닝 프레임워크를 개발하기 위해.
  • 포트폴리오 최적화에서 스토크라스틱 재귀 유틸리티 모델에 적용하여 금융 응용 분야에서의 효과성을 입증하기 위해.

제안 방법

  • 스토크라스틱 최적제어 문제를 리더가 시스템을 제어하고 팔로워가 상태 및 양방향 과정을 결정하는 스토크라스틱 스택엘베르그 미분게임으로 재구성한다.
  • 리더의 제어 $u(\cdot)$를 근사하기 위한 하나의 피드포워드 신경망과, 역방향 구성요소의 초기값 $y_0$와 확산 계수 $z(\cdot)$를 근사하기 위한 두 개의 신경망을 구축한다.
  • 두 개의 비용 기능을 정의한다: 리더의 최적화를 위한 $J(u(\cdot))$와 팔로워의 종단 조건 오차 최소화를 위한 $J(y_0, z(\cdot))$.
  • 팔로워의 네트워크를 $\kappa \geq 1$단계 업데이트한 후에 리더의 네트워크를 한 번 업데이트하는 교차 최적화(CO) 알고리즘을 구현한다.
  • 비용 기능 내 기대값을 추정하기 위해 몬테카를로 샘플링을 사용하여 확률적 경사하강법 학습을 가능하게 한다.
  • 수치 실험을 통해 재귀 유틸리티를 가진 두 가지 투자-소비 문제에 이 방법을 적용하여 성능를 검증한다.

실험 결과

연구 질문

  • RQ1딥러닝은 완전히 결합된 FBSDEs에 의해 구동되는 고차원 스토크라스틱 최적제어 문제를 효과적으로 해결할 수 있는가?
  • RQ2제안된 스택엘베르그 기반 교차 최적화 방법은 고차원에서 기존의 FBSDE 수치 해법과 비교해 어떻게 성능을 냈는가?
  • RQ3팔로워 업데이트 횟수($\kappa$)가 해의 수렴성과 안정성에 미치는 영향는 어떠한가?
  • RQ4재귀 유틸리티 모델에서 초기값 $y_0$와 제어 $u(\cdot)$를 얼마나 정확하게 복원할 수 있는가?
  • RQ5투자-소비 문제에서 다양한 시간 간격과 차원에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • 이 방법은 재귀 유틸리티 하에서 두 개의 고차원 투자-소비 문제를 성공적으로 해결하였으며, 다양한 시간 간격에서 안정적이고 정확한 결과를 도출하였다.
  • $T=1.00$ 및 $n=50$일 때, $y_0$의 적분형과 매개변수형 사이의 평균 거리는 $0.00101 \pm 1.36 \times 10^{-7}$였으며, 이는 높은 수렴 정확도를 의미한다.
  • $\kappa=1$일 때, 두 $y_0$ 형태 사이의 거리는 $0.00124 \pm 1.58 \times 10^{-7}$였지만, $\kappa=1/49$일 때는 $0.06069 \pm 1.11 \times 10^{-7}$로 크게 증가하여 $\kappa>1$일 때 안정성이 향상됨을 보여준다.
  • $\kappa=9$일 때, 거리는 $0.00043 \pm 2.08 \times 10^{-7}$로 감소하여, 팔로워 업데이트 횟수가 많을수록 해의 형태 간 일치도 향상됨을 확인하였다.
  • $n=50$, $T=0.5$의 경우, 반복 과정에서 매개변수형과 적분형 $y_0$가 밀접하게 수렴하였으며, 평균 값은 5000개의 학습 스텝 이후에 안정화되었다.
  • 결과는 CO 방법이 효과적이고 강건하며, 특히 $\kappa > 1$일 때 기존의 $\kappa=1$ 설정보다 뛰어난 성능을 보임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.