Skip to main content
QUICK REVIEW

[論文レビュー] A deep learning method for solving stochastic optimal control problems driven by fully-coupled FBSDEs

Shaolin Ji, Shigē Péng|arXiv (Cornell University)|Apr 12, 2022
Energy, Environment, and Transportation Policies被引用数 4
ひとこと要約

本稿では、完全に結合された前向き・後向きストキャスティック微分方程式(FBSDE)によって駆動される高次元確率的最適制御問題を解くために、クロス最適化(CO)フレームワークに基づくディープラーニング手法を提案する。問題を確率的スタックルベルク微分ゲームに再定式化し、ディープニューラルネットワークを用いてリーダーの制御とフォロワーの状態変数を交互に最適化することで、再帰的効用モデルを用いた2つの投資・消費例において高精度な解を得た。

ABSTRACT

In this paper,we mainly focus on the numerical solution of high-dimensional stochastic optimal control problem driven by fully-coupled forward-backward stochastic differential equations (FBSDEs in short) through deep learning. We first transform the problem into a stochastic Stackelberg differential game problem (leader-follower problem), then a bi-level optimization method is developed where the leader's cost functional and the follower's cost functional are optimized alternatively via deep neural networks. As for the numerical results, we compute two examples of the investment-consumption problem solved through stochastic recursive utility models, and the results of both examples demonstrate the effectiveness of our proposed algorithm.

研究の動機と目的

  • 完全に結合されたFBSDEによって支配される高次元確率的最適制御問題に対する数値的手法の不足に対処すること。
  • 従来のPDEまたは確率的手法では解くのが計算的に困難な高次元FBSDEを克服すること。
  • FBSDEにおける結合された前向きおよび後向きダイナミクスを扱えるスケーラブルなディープラーニングフレームワークを開発すること。
  • ポートフォリオ最適化における確率的再帰的効用モデルへの応用を通じて、金融分野における有効性を実証すること。

提案手法

  • 確率的最適制御問題を、リーダーがシステムを制御し、フォロワーが状態および共役過程を決定する確率的スタックルベルク微分ゲームに再定式化する。
  • 3つのフィードフォワードニューラルネットワークを構築する:リーダーの制御 $u(\cdot)$ を近似するネットワーク、および後向き成分の初期値 $y_0$ と拡散係数 $z(\cdot)$ を近似する2つのネットワーク。
  • 2つのコスト関数を定義する:リーダーの最適化のための $J(u(\cdot))$ と、終端条件誤差のフォロワーの最小化のための $J(y_0, z(\cdot))$。
  • フォロワーのネットワークを $\kappa \geq 1$ ステップ更新した後に1回だけリーダーのネットワークを更新する、クロス最適化(CO)アルゴリズムを実装する。
  • 期待値をモンテカルロサンプリングで推定することで、確率的勾配降下法による学習を可能にする。
  • 数値実験を通じて、再帰的効用を伴う2つの投資・消費問題にこの手法を適用し、性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングは、完全に結合されたFBSDEによって駆動される高次元確率的最適制御問題を効果的に解けるか?
  • RQ2提案されたスタックルベルクベースのクロス最適化手法は、高次元における既存のFBSDE数値スキームと比較してどのように差をつけるか?
  • RQ3フォロワーの更新回数($\kappa$)が解の収束性および安定性に与える影響は何か?
  • RQ4再帰的効用モデルにおいて、初期値 $y_0$ および制御 $u(\cdot)$ をどれほど正確に回復できるか?
  • RQ5投資・消費問題における異なる時間スケールおよび次元において、この手法はどれほど頑健か?

主な発見

  • 本手法は、再帰的効用下での2つの高次元投資・消費問題を安定的かつ高精度に解き、複数の時間スケールで良好な結果を得た。
  • 時間 $T=1.00$ および次元 $n=50$ の場合、$y_0$ の積分形とパラメトリック形の間の平均距離は $0.00101 \pm 1.36 \times 10^{-7}$ であり、高い収束精度を示した。
  • $\kappa=1$ の場合、2つの $y_0$ 形式間の距離は $0.00124 \pm 1.58 \times 10^{-7}$ であったが、$\kappa=1/49$ では著しく $0.06069 \pm 1.11 \times 10^{-7}$ に増加し、$\kappa>1$ が安定性を向上させることを示した。
  • $\kappa=9$ の場合、距離は $0.00043 \pm 2.08 \times 10^{-7}$ に低下し、フォロワーの更新回数を増やすことで解の形がよりよく一致することを示した。
  • パラメトリック形と積分形の $y_0$ は反復の過程で密接に一致し、$n=50$、$T=0.5$ の場合、5000学習ステップ後に平均値が安定した。
  • 結果から、CO手法が有効かつ頑健であり、特に $\kappa > 1$ の場合に、$\kappa=1$ のベースライン設定を上回ることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。