[論文レビュー] Deep Reinforcement Learning for Active High Frequency Trading
本稿では、限界委託価格注文書(LOB)データを用いたプロキシマル・ポリシー最適化(PPO)に基づく、最初のエンドツーエンドの深層強化学習(DRL)フレームワークを、アクティブなハイフリクエンシートレーディングに適用した。3か月間のインテル株価データを用い、信号最適化されたサンプリングで訓練されたエージェントは、出所外で安定した正のリターンを達成した。これは、DRLが、報酬が疎であり、市場への影響が限定的であるにもかかわらず、非常に確率的かつ非ステーションナリィな環境において一時的な市場非効率性を活用できることを示している。
We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.
研究の動機と目的
- 実際の金融市場におけるアクティブなハイフリクエンシートレーディングのためのエンドツーエンドの深層強化学習フレームワークを開発・検証すること。
- 特に、時価評価損益(P&L)を含む状態表現の違いが、非定常的かつ高ノイズ環境下でのエージェント性能に与える影響を調査すること。
- 報酬が疎であり、市場への影響が限定的であるにもかかわらず、DRLエージェントが利益を上げる動的取引戦略を学習できるかどうかを評価すること。
- 短期的な市場非効率性が存在し、高度なRL技術を用いて体系的かつ一貫して活用可能であるという実証的証拠を提供すること。
提案手法
- インテル社株式の連続する3か月間のハイフリクエンシートレーディング用限界委託価格注文書(LOB)データを用い、プロキシマル・ポリシー最適化(PPO)アルゴリズムでDRLエージェントを訓練した。
- 信号対ノイズ比を向上させるために、価格変動が最大の期間に限定して選択された信号最適化訓練セットを構築した。
- 学習の安定性とパフォーマンスを向上させるために、順次モデルベース最適化(SMBO)をハイパーパrameterチューニングに採用した。
- LOBメタ特徴に基づく3つの異なる状態表現を定義した。そのうちの1つは、エージェントの現在の時価評価損益(P&L)を含むものである。
- 継続的学習の枠組みを採用し、最終月のデータを検証用、その後の月のデータをテスト用に使用した。
- 位置・保有の終了時にのみフィードバックが得られる報酬形状戦略を適用し、実際の取引コストとダイナミクスを反映した。
実験結果
リサーチクエスチョン
- RQ1深層強化学習エージェントは、非常に確率的かつ非定常的なハイフリクエンシートレーディング環境において、利益を上げる動的取引戦略を学習できるか?
- RQ2状態表現に時価評価損益(P&L)を含めることで、DRLベース取引エージェントのパフォーマンスと収益性にどのような影響が生じるか?
- RQ3DRLエージェントは、限界委託価格注文書データにおける一時的市場非効率性をどの程度活用し、安定した正のリターンを生成できるか?
- RQ4異なるLOBベースの状態表現の特徴付けは、DRLエージェントの出所外性能と耐性にどのような影響を及ぼすか?
- RQ5Bid-askスプレッドと報酬が疎である状況を考慮しても、DRLベースエージェントは一貫してパassing市場ベンチマークを上回ることができるか?
主な発見
- DRLエージェントは、価格予測可能性が欠如しているにもかかわらず、テスト期間全体で安定した正の純利益を達成し、パassing市場ベンチマークを一貫して上回った。
- 状態表現に自身の現在の時価評価損益(P&L)を含めることが可能なエージェントは、より高い累積リターンと優れた取引実行品質を達成した。
- 総収益性の差の主な要因は、個々の取引のパフォーマンスではなく、取引回数であった。
- エージェントは、強いフィードバックループや非線形ダイナミクスが存在する中でも、限界委託価格注文書データに偶発的な規則性や一時的非効率性を識別・活用する能力を示した。
- 報酬の疎らさに対してフレームワークは頑健であり、エージェントは、位置を数十から数万ステップにわたり保有した後、最終的に閉じることを学習しており、効果的な長期計画が可能であることを示した。
- 結果は、強形式の市場効率性仮説に反する実証的証拠を提供しており、マイクロ構造データにおいて短期的な活用可能な非効率性が継続的に存在することを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。