Skip to main content
QUICK REVIEW

[論文レビュー] Model-based Reinforcement Learning for Predictions and Control for Limit Order Books

Haoran Wei, Yuanbo Wang|arXiv (Cornell University)|Oct 9, 2019
Stock Market Forecasting Methods参考文献 29被引用数 13
ひとこと要約

本論文は、限界注文書データのみを用いて、市場のダイナミクスをシミュレートする学習済み環境モデルを用いて、リアルタイムの市場インタラクションを必要とせずに取引エージェントを訓練するモデルベース強化学習フレームワークを提案する。このアプローチにより、実市場で利益を上げられ、転送可能なポリシーを達成し、多様な市場環境においても優れたサンプル効率性と安定性を示す。

ABSTRACT

We build a profitable electronic trading agent with Reinforcement Learning that places buy and sell orders in the stock market. An environment model is built only with historical observational data, and the RL agent learns the trading policy by interacting with the environment model instead of with the real-market to minimize the risk and potential monetary loss. Trained in unsupervised and self-supervised fashion, our environment model learned a temporal and causal representation of the market in latent space through deep neural networks. We demonstrate that the trading policy trained entirely within the environment model can be transferred back into the real market and maintain its profitability. We believe that this environment model can serve as a robust simulator that predicts market movement as well as trade impact for further studies.

研究の動機と目的

  • 金融市場とのリアルタイムのインタラクションを必要とせずに、利益を上げる取引ポリシーを学習するモデルベース強化学習フレームワークの開発。
  • 潜在空間における自己教師付き表現学習を用いて、注文書の時間的・因果的ダイナミクスを捉えるデータ駆動型環境モデルの構築。
  • シミュレートされた環境で訓練されたポリシーを、実市場に一貫して利益をもたらす形で転送可能にする。
  • モデルフリー強化学習の金融分野における限界、例えば高いサンプル複雑性と試行錯誤によるリスクを是正する。
  • 電子取引における市場動向や取引インパactsの予測に耐性があり、汎用的なシミュレータを提供する。

提案手法

  • フレームワークは、時間的・因果的依存関係を捉えるために、歴史的データから注文書の潜在空間表現を学習する深層ニューラルネットワークを用いる。
  • 対照的学習を用いて自己教師付きで学習された世界モデルが、現在の観測と行動から将来の状態と報酬を予測する。
  • 強化学習エージェントは、ポリシー勾配(PG)、A2C、またはDQNアルゴリズムを用いて、学習済み環境モデル内でのみ訓練される。
  • 状態遷移と報酬信号の両方のエンドツーエンド表現を学習し、市場の進化と取引インパクトの両方を同時に予測可能にする。
  • ポリシーは、実市場データへの転送により評価され、異なる市場環境における累積PnLを比較する。
  • システムはサンプル効率性と耐性を重視しており、訓練中における実市場リスクへの露出を最小限に抑える設計である。

実験結果

リサーチクエスチョン

  • RQ1モデルベース強化学習エージェントは、限界注文書の歴史的データのみを用いて、リアルタイムの環境インタラクションなしに利益を上げる取引ポリシーを学習できるか?
  • RQ2自己教師付き世界モデルは、効果的なポリシー訓練のため、注文書の時間的・因果的ダイナミクスをどの程度正確に捉えることができるか?
  • RQ3シミュレートされた環境で訓練されたポリシーは、実市場条件にどの程度転送可能であり、利益を維持できるか?
  • RQ4モデルベース強化学習エージェントの性能は、異なる市場環境において、従来のベンチマーク戦略(例:モーメンタムベース、分類器ベース)と比較してどうなるか?
  • RQ5本アプローチの限界は、トレンド信号が限られるような低データ環境(例:変動する市場)においてどのように現れるか?

主な発見

  • 環境モデル内でのみ訓練されたRLエージェントは、グリーディーオプティマル解の10%〜30%以内の累積PnLを達成し、平均的にモーメンタムベースおよび分類器ベースのベンチマークを上回った。
  • A2CアルゴリズムはPGおよびDQNよりもより安定したパフォーマンスを示したが、DQNは不適切な状態表現のため性能が低かった。
  • 分類器ベースエージェントはクラスの不均衡のため性能が低く、価格変動を「変化なし」と誤分類し、行動を取る頻度が少なかった。
  • RLエージェントは上行市場および下行市場では優れたパフォーマンスを示したが、変動する市場では訓練データが不足(全データの約15.8%)であったため苦戦した。
  • 世界モデルで訓練されたポリシーは、実市場条件への転送に成功し、ランダムに選択された5日間の間で、漸近的かつ一貫したパフォーマンスを示した。
  • 環境モデルは市場動向と取引インパクトを効果的に予測でき、今後の研究における耐性のあるシミュレータとしての有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。