Skip to main content
QUICK REVIEW

[論文レビュー] DeepScalper: A Risk-Aware Reinforcement Learning Framework to Capture Fleeting Intraday Trading Opportunities

Shuo Sun, Xue, Wanqi|arXiv (Cornell University)|Dec 15, 2021
Financial Markets and Investment Strategies被引用数 6
ひとこと要約

DeepScalper は、ダイング Q ネットワークとアクション分岐、後悔報酬関数、エンコーダ・デコーダアーキテクチャによるマルチモーダル市場表現、およびボラティリティ予測の補助タスクを組み合わせることで、高頻度の intraday トレーディングを可能にするリスクに配慮した強化学習フレームワークである。6つの金融先物において、合計リターン、シャープレシオ、リスク調整後のパフォーマンスの観点で、最先端のベースラインを著しく上回る性能を発揮する。

ABSTRACT

Reinforcement learning (RL) techniques have shown great success in many challenging quantitative trading tasks, such as portfolio management and algorithmic trading. Especially, intraday trading is one of the most profitable and risky tasks because of the intraday behaviors of the financial market that reflect billions of rapidly fluctuating capitals. However, a vast majority of existing RL methods focus on the relatively low frequency trading scenarios (e.g., day-level) and fail to capture the fleeting intraday investment opportunities due to two major challenges: 1) how to effectively train profitable RL agents for intraday investment decision-making, which involves high-dimensional fine-grained action space; 2) how to learn meaningful multi-modality market representation to understand the intraday behaviors of the financial market at tick-level. Motivated by the efficient workflow of professional human intraday traders, we propose DeepScalper, a deep reinforcement learning framework for intraday trading to tackle the above challenges. Specifically, DeepScalper includes four components: 1) a dueling Q-network with action branching to deal with the large action space of intraday trading for efficient RL optimization; 2) a novel reward function with a hindsight bonus to encourage RL agents making trading decisions with a long-term horizon of the entire trading day; 3) an encoder-decoder architecture to learn multi-modality temporal market embedding, which incorporates both macro-level and micro-level market information; 4) a risk-aware auxiliary task to maintain a striking balance between maximizing profit and minimizing risk. Through extensive experiments on real-world market data spanning over three years on six financial futures, we demonstrate that DeepScalper significantly outperforms many state-of-the-art baselines in terms of four financial criteria.

研究の動機と目的

  • 高次元で細分化されたアクション空間における一時的な intraday トレーディング機会を的確に捉える課題に対処すること。
  • マイクロレベルとマクロレベルの市場データを統合することで、意味のあるマルチモーダル市場表現を学習すること。
  • 報酬関数に後悔報酬を組み込むことで、長期的な意思決定を向上させること。
  • ボラティリティ予測の補助タスクを導入することで、訓練の安定性とリスク認識を高めること。
  • 訓練中に特定の資産に限定された露出しか得られない状況においても、多様な金融商品に対して堅牢な一般化を達成すること。

提案手法

  • 高次元の intraday トレーディングアクション空間における RL エージェントの訓練を効率的に行うために、アクション分岐を施したダイング Q ネットワークが用いられる。
  • 後悔報酬を備えた新しい報酬関数が、エージェントが1日全体の価格トレンドを考慮するのを促し、長期的な意思決定を促進する。
  • エンコーダ・デコーダアーキテクチャにより、マイクロレベルのオーダーブックデータとマクロレベルの価格トレンドを統合し、時系列的な市場埋め込みを学習する。
  • リスクに配慮した補助タスクとして、市場ボラティリティを予測することで、訓練中に利益最大化とリスク最小化のバランスを取る。
  • フレームワークは、2つの株価インデックスと4つの国債先物を含む6つの金融先物のリアルタイムティックデータを用いて、エンドツーエンドで訓練される。
  • 後悔報酬の時間窓や補助タスクの重みといったハイパーパrameterは、アブレーションスタディにより最適化され、パフォーマンスが向上する。

実験結果

リサーチクエスチョン

  • RQ1高次元で細分化されたアクション空間における intraday トレーディングのための強化学習エージェントを、どのように効果的に訓練できるか?
  • RQ2報酬関数に後悔報酬を組み込むことで、長期的な intraday トレーディングパフォーマンスはどの程度向上するか?
  • RQ3マイクロレベルとマクロレベルのデータを統合したマルチモーダル市場表現は、エージェントの intraday 市場ダイナミクス理解を向上させることができるか?
  • RQ4ボラティリティ予測の補助タスクを組み込むことで、訓練の安定性とリスク調整後のリターンにどのような影響を与えるか?
  • RQ5訓練中にそのデータに露出していないにもかかわらず、DeepScalper は未観測の金融商品に対しても一般化性能を示せるか?

主な発見

  • DeepScalper は、6つの金融先物すべてにおいて、すべてのベースラインの中で最高の合計リターンを達成しており、一部のケースでは次善の手法よりも20–30%の改善を示している。
  • 後悔報酬を用いて訓練されたエージェントは、長期的な時間枠への意識が高く、例えば1日全体の下落トレンドを早期に把握し、大規模なショートポジションを開始する能力を示している。
  • リスクに配慮した補助タスクにより、複数のランダムシードにおけるパフォーマンスのばらつきが低減され、6つの資産すべてで合計リターンおよびシャープレシオの標準偏差が低下した。
  • フレームワークは未観測の金融商品に対しても堅牢に一般化する:DeepScalper は、TF02 のデータでのみ訓練されたにもかかわらず、T02 先物においても一貫して高いパフォーマンスを発揮するが、MV や GRU や LGBM は同様の性能を示さない。
  • アブレーションスタディにより、アクション分岐、後悔報酬、マルチモーダルエンコーディング、リスク補助タスクの各要素が、全体のパフォーマンス向上に顕著に寄与することが確認された。
  • 最適な後悔報酬の時間窓は、180タイムステップ(約30分)であると判明した。これより長い時間窓では、長期的シグナルへの過剰適合によりパフォーマンスが低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。