[論文レビュー] Deep Reinforcement Learning for Optimal Stopping with Application in Financial Engineering
本稿では、ファイナンシャル・エンジニアリングにおける最適停止問題に深層強化学習(DRL)を適用し、DDQN、C51、IQNアルゴリズムを用いてバミューディアン・オプションの最適行使ポリシーを学習する。S&P 500データにおいて、C51はベンチマーク比8%高いアウト・オブ・サンプルリターンを達成する一方、IQNはブラック=ショールズのダイナミクス下で理論的オプション価格に非常に近い結果を示す。
Optimal stopping is the problem of deciding the right time at which to take a particular action in a stochastic system, in order to maximize an expected reward. It has many applications in areas such as finance, healthcare, and statistics. In this paper, we employ deep Reinforcement Learning (RL) to learn optimal stopping policies in two financial engineering applications: namely option pricing, and optimal option exercise. We present for the first time a comprehensive empirical evaluation of the quality of optimal stopping policies identified by three state of the art deep RL algorithms: double deep Q-learning (DDQN), categorical distributional RL (C51), and Implicit Quantile Networks (IQN). In the case of option pricing, our findings indicate that in a theoretical Black-Schole environment, IQN successfully identifies nearly optimal prices. On the other hand, it is slightly outperformed by C51 when confronted to real stock data movements in a put option exercise problem that involves assets from the S&P500 index. More importantly, the C51 algorithm is able to identify an optimal stopping policy that achieves 8% more out-of-sample returns than the best of four natural benchmark policies. We conclude with a discussion of our findings which should pave the way for relevant future research.
研究の動機と目的
- 最適停止問題を解くための最先端の深層強化学習アルゴリズムを、ファイナンシャル・エンジニアリング分野で評価すること。
- 市場のボラティリティを伴う現実世界のオプション価格設定および行使シナリオにおいて、DDQN、C51、IQNの性能を比較すること。
- DRLが実株価データを用いたアウト・オブ・サンプル設定において、古典的モデル(バイナリーツリー)を上回る性能を示すかどうかを検証すること。
- 異なるDRLアーキテクチャにおける計算コスト、トレーニング速度、パフォーマンスのトレードオフを調査すること。
- 非ステーションナリィな金融環境における汎化性能を向上させるためのハイパーパrameter感受性およびトレーニング戦略を探索すること。
提案手法
- 時系列価格データ内の時間的依存性をモデル化するため、LSTMネットワークを統合した3つの深層RLアルゴリズム(DDQN、C51、IQN)を適応的に適用する。
- 行動価値関数近似における過大評価バイアスを低減するために、ダブルQ学習を採用する。
- 状態価値と行動アドバンテージを別々に推定するデュアルネットワークアーキテクチャを採用し、高次元の行動空間におけるポリシー評価を改善する。
- マルチステップのブートストラップを適用し、価値関数学習におけるバイアス・バリアンスのトレードオフをバランスさせるとともに、報酬伝搬を加速する。
- 歴史的S&P 500株価データを用いてモデルをトレーニングし、ハイパーパramータチューニングのためのバリデーションセットと、アウト・オブ・サンプルパフォーマンス評価のためのテストセットを用いる。
- 歴史的ボラティリティを用いてリスク中立的測度に従ってオプション価格をキャリブレーションし、期待リターンおよびオプションペイアウトメトリクスを計算する。
実験結果
リサーチクエスチョン
- RQ1幾何ブラウン運動下で、深層強化学習アルゴリズムは近似的に最適な停止ポリシーを学習できるか?
- RQ2実際のS&P 500株価データに適用した場合、C51、IQN、DDQNのパフォーマンスはどのように比較されるか?
- RQ3DRLは、実際の株価データを用いたアウト・オブ・サンプルのオプション行使リターンにおいて、古典的ベンチマーク(バイナリーツリー)をどの程度上回るか?
- RQ4ボラティリティが高く非定常な金融環境下で、IQN、C51、DDQNの間の計算コストと汎化性能のトレードオフはいかなるものか?
- RQ5トレーニングエピソードの時間的順序を考慮することで、非定常市場におけるアウト・オブ・サンプルパフォーマンスが向上するか?
主な発見
- 理論的ブラック=ショールズ環境下では、IQNはほぼ最適なオプション価格を特定でき、制御された環境下での強力なパフォーマンスを示した。
- 実際のS&P 500データでは、C51が4つの自然なベンチマークポリシーすべてを上回り、アウト・オブ・サンプル期待オプションリターンが8%高い(22.0% 対 最良ベンチマークの14.0%)。
- C51はテストセットで平均期待報酬0.0291を達成し、IQN(0.0285)およびDDQN(0.0274)を上回った。90%信頼区間は1.6%であった。
- IQNは優れたデータフィッティング能力を示すが、特に高ボラティリティまたは非マルコフ的環境では過学習に陥りやすい。
- DDQNはIQNの1.2–1.5倍、C51の2–4倍速く、期待報酬およびリターンメトリクスにおいて両者を下回るが、計算速度は優れている。
- IQNはDDQNに比べて顕著にメモリを多く消費しており、パフォーマンスとリソース効率の間の重要なトレードオフを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。