Skip to main content
QUICK REVIEW

[論文レビュー] Reinforced Deep Markov Models With Applications in Automatic Trading

Tadeu Augusto Ferreira|arXiv (Cornell University)|Nov 9, 2020
Stock Market Forecasting Methods参考文献 27被引用数 4
ひとこと要約

本稿では、変分オートエンコーダーとディープマーカフモデルを統合することで、ノイズが多く不完全な市場データを扱えるモデルベース強化学習フレームワーク、強化型ディープマーカフモデル(RDMM)を提案する。観測値をフィルタリングし、状態の不確実性を政策学習に組み込むことで、データ効率性と金融パフォーマンスが向上し、フェイスブック、インテル、ボーダフォン、マイクロソフトのリアルなリミットオーダーブックデータにおいて、Q学習、DynaQ-ARIMA、DynaQ-LSTMのベンチマークを上回る結果を得た。

ABSTRACT

Inspired by the developments in deep generative models, we propose a model-based RL approach, coined Reinforced Deep Markov Model (RDMM), designed to integrate desirable properties of a reinforcement learning algorithm acting as an automatic trading system. The network architecture allows for the possibility that market dynamics are partially visible and are potentially modified by the agent's actions. The RDMM filters incomplete and noisy data, to create better-behaved input data for RL planning. The policy search optimisation also properly accounts for state uncertainty. Due to the complexity of the RKDF model architecture, we performed ablation studies to understand the contributions of individual components of the approach better. To test the financial performance of the RDMM we implement policies using variants of Q-Learning, DynaQ-ARIMA and DynaQ-LSTM algorithms. The experiments show that the RDMM is data-efficient and provides financial gains compared to the benchmarks in the optimal execution problem. The performance improvement becomes more pronounced when price dynamics are more complex, and this has been demonstrated using real data sets from the limit order book of Facebook, Intel, Vodafone and Microsoft.

研究の動機と目的

  • 高次元でノイズの多い金融環境における部分的観測下で、古典的Q学習の限界を克服すること。
  • 政策学習プロセスに不確実性モデリングを統合することで、アルゴリズム取引におけるデータ効率性とロバスト性を向上させること。
  • 金融時系列のための、ディープ生成モデルとモデルベース強化学習を統合する包括的フレームワークの開発。
  • 複雑な価格ダイナミクスを示すリアルマーケットデータを用いて、最適実行タスクにおける提案されたRDMMのパフォーマンスを、既存のベンチマークと比較して評価すること。

提案手法

  • RDMMは、変分推論を用いてノイズが多く不完全な市場観測から潜在状態をモデル化する、ディープマーカフモデルアーキテクチャを採用する。
  • 観測ノイズとモデルの不確実性の両方を考慮し、潜在状態の事後分布を推定する微分可能フィルタリング機構を用いる。
  • フィルタリングされた状態推定値における不確実性を明示的に組み込みながら、期待リターンを最大化する勾配ベースのアプローチで政策を最適化する。
  • 学習済みのダイナミクスモデルを用いたモデルベース計画を統合し、効率的な経験リプレイとシミュレーションベースの学習を可能にする。
  • 時間方向のバックプロパゲーションと微分可能な強化学習目的関数を用いて、エンドツーエンドでモデルを訓練し、コンポonentの寄与度を分離するアブレーションスタディを実施する。
  • ベースラインとしてQ学習、DynaQ-ARIMA、DynaQ-LSTMを用い、DynaQにおけるモデルコンponentをRDMMに置き換えて評価する。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、部分的観測下の強化学習ベースのアルゴリズム取引において、データ効率性とパフォーマンスを向上させることができるか?
  • RQ2政策最適化に状態の不確実性を組み込むと、最適実行タスクにおける金融パフォーマンスにどのような影響を与えるか?
  • RQ3複雑な価格ダイナミクスを示すリアルマーケットデータにおいて、RDMMは標準的なモデルフリーおよびモデルベースのベンチマークを上回るか?
  • RQ4VAE、DMM、不確実性を考慮した政策の各コンポーネントが、全体のパフォーマンスに果たす寄与度は何か?

主な発見

  • フェイスブック、インテル、ボーダフォン、マイクロソフトの全株式において、Q学習、DynaQ-ARIMA、DynaQ-LSTMと比較して、RDMMは顕著な金融的利益を達成した。特に複雑な市場環境下で性能向上が顕著に現れた。
  • 正確な状態フィルタリングと不確実性を考慮した計画を組み込むことで、データ効率性に優れ、少ない相互作用回数で効果的な政策を学習した。
  • アブレーションスタディの結果、変分推論と不確実性モデリングの統合が、特にノイズが多いまたは不完全な観測下でパフォーマンスに不可欠であることが確認された。
  • フェイスブック、インテル、ボーダフォン、マイクロソフトのリアルなリミットオーダーブックデータを用いた評価において、RDMMは累積利益およびリスク調整リターンの両面で、すべてのベースラインを一貫して上回った。
  • 市場の複雑さが増すほどパフォーマンス向上が顕著になることから、ボラティリティが高くマルコフ的でない環境においても、本モデルのロバスト性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。