Skip to main content
QUICK REVIEW

[論文レビュー] Deep neural networks algorithms for stochastic control problems on finite horizon: numerical applications

Achref Bachouch, Côme Huré|arXiv (Cornell University)|Dec 13, 2018
Stochastic processes and financial applications参考文献 25被引用数 68
ひとこと要約

本稿では、性能反復およびハイブリッド反復アルゴリズムを用いて、価値関数と最適方策の近似にニューラルネットワークを用いる深層学習ベースのアルゴリズム—NNcontPI、Hybrid-Now、Hybrid-LaterQ、ClassifHybrid—を提案する。これらの手法は、100次元のPDE、オプションヘッジ、マイクログリッド管理問題における実証的検証を通じて、特に高次元において、量子化ベースのベンチマーク(例:Qknn)と比較して競争的または優れた性能を達成している。

ABSTRACT

This paper presents several numerical applications of deep learning-based algorithms that have been introduced in [HPBL18]. Numerical and comparative tests using TensorFlow illustrate the performance of our different algorithms, namely control learning by performance iteration (algorithms NNcontPI and ClassifPI), control learning by hybrid iteration (algorithms Hybrid-Now and Hybrid-LaterQ), on the 100-dimensional nonlinear PDEs examples from [EHJ17] and on quadratic backward stochastic differential equations as in [CR16]. We also performed tests on low-dimension control problems such as an option hedging problem in finance, as well as energy storage problems arising in the valuation of gas storage and in microgrid management. Numerical results and comparisons to quantization-type algorithms Qknn, as an efficient algorithm to numerically solve low-dimensional control problems, are also provided; and some corresponding codes are available on https://github.com/comeh/.

研究の動機と目的

  • 高次元の有限時限確率的制御問題における次元の呪いを、深層ニューラルネットワークを用いて克服すること。
  • 性能反復およびハイブリッド反復アルゴリズムを導入することで、アクター・クリティック強化学習手法を有限時限問題へ拡張すること。
  • 高次元および低次元の制御問題における、深層学習ベースのアルゴリズムの数値的妥当性を検証すること。
  • 精度および計算効率の観点から、提案手法を確立された量子化ベースの手法(Qknn)と比較すること。
  • ガス貯蔵やマイクログリッド管理などの複雑な現実世界の制御問題を解くことにおける、深層学習の実現可能性と有効性を示すこと。

提案手法

  • 制御方策と価値関数をそれぞれパrameter θ および β を用いてパラメータ化する深層ニューラルネットワーク(DNN)を用いる。
  • モンテカルロ回帰を用いて、性能反復(PI)およびハイブリッド反復スキームにより、方策および価値関数の推定値を反復的に改善する。
  • 二種類の訓練戦略バリエーションを適用する:報酬最適化専用(知識に基づく)および探索後に最適化(初期方策推定からの経験的測度を用いる)。
  • 分類と回帰を組み合わせたハイブリッドアプローチ(ClassifHybrid)を採用し、マイクログリッド管理におけるような混合離散連続制御空間を効果的に扱う。
  • 各時刻ステップで状態をサンプリングするための訓練測度 µn を、一様分布または経験的分布を用いて設計する。
  • 次時刻の重みを用いて価値関数ネットワークを事前学習することで、収束を加速させ、推定値の時間的安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1従来の手法が次元の呪いにより失敗する高次元の確率的制御問題において、深層学習ベースのアルゴリズムが効果的に機能するか。
  • RQ2100次元の非線形PDEおよび2次型BSDEにおいて、性能反復とハイブリッド反復アルゴリズムの精度および計算コストの観点での比較は。
  • RQ3低次元の制御問題において、提案された深層学習手法が量子化ベースの手法(例:Qknn)をどの程度上回るか。
  • RQ4訓練分布の選択(報酬最適化 vs. 探索)が、学習済み方策の収束性および精度に与える影響は。
  • RQ5ハイブリッドニューラルネットワークアーキテクチャは、マイクログリッド管理におけるような混合離散連続制御空間を、標準的手法よりも効果的に扱えるか。

主な発見

  • マイクログリッド問題において、N=30のときClassifHybridは価値関数推定値33.34(±0.31)を達成し、Qknnの推定値35.37(±0.34)を上回った。
  • N=200のとき、Qknnは価値関数を231.8(±1.2)と推定し、長期間にわたり安定した性能を示した。
  • マイクログリッド問題において、Hybrid-NowはQknnを上回ったが、Qknnの1分未満の実行時間に対し7分を要した。
  • Qknnが得た最適意思決定は自然な挙動を示した:バッテリー容量が不足している場合に発電機を稼働させ、需要が負またはバッテリーが満タンの場合は停止した。
  • ClassifHybridは、マイクログリッド管理における混合離散連続制御空間を効果的に管理し、複雑さにもかかわらずQknnを上回る結果を達成した。
  • 次時刻の重みを用いた価値関数ネットワークの事前学習は、訓練時間を顕著に短縮し、推定値の時間的安定性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。