Skip to main content
QUICK REVIEW

[論文レビュー] EarnHFT: Efficient Hierarchical Reinforcement Learning for High Frequency Trading

Molei Qin, Shuo Sun|arXiv (Cornell University)|Sep 22, 2023
Financial Markets and Investment Strategies被引用数 4
ひとこと要約

EarnHFTは、Q-teacherを用いて訓練効率を向上させ、トレンド別に最適化された強化学習エージェントの多様なプールと、分単位のルータを統合した三段階の階層的強化学習フレームワークを提案する。高精細シミュレーションにおいて、6つの金融指標で最先端のベースラインを30%以上上回る収益性を達成した。

ABSTRACT

High-frequency trading (HFT) uses computer algorithms to make trading decisions in short time scales (e.g., second-level), which is widely used in the Cryptocurrency (Crypto) market (e.g., Bitcoin). Reinforcement learning (RL) in financial research has shown stellar performance on many quantitative trading tasks. However, most methods focus on low-frequency trading, e.g., day-level, which cannot be directly applied to HFT because of two challenges. First, RL for HFT involves dealing with extremely long trajectories (e.g., 2.4 million steps per month), which is hard to optimize and evaluate. Second, the dramatic price fluctuations and market trend changes of Crypto make existing algorithms fail to maintain satisfactory performance. To tackle these challenges, we propose an Efficient hieArchical Reinforcement learNing method for High Frequency Trading (EarnHFT), a novel three-stage hierarchical RL framework for HFT. In stage I, we compute a Q-teacher, i.e., the optimal action value based on dynamic programming, for enhancing the performance and training efficiency of second-level RL agents. In stage II, we construct a pool of diverse RL agents for different market trends, distinguished by return rates, where hundreds of RL agents are trained with different preferences of return rates and only a tiny fraction of them will be selected into the pool based on their profitability. In stage III, we train a minute-level router which dynamically picks a second-level agent from the pool to achieve stable performance across different markets. Through extensive experiments in various market trends on Crypto markets in a high-fidelity simulation trading environment, we demonstrate that EarnHFT significantly outperforms 6 state-of-art baselines in 6 popular financial criteria, exceeding the runner-up by 30% in profitability.

研究の動機と目的

  • 高頻度取引(HFT)における訓練データの非効率性の課題に取り組む。これは、極めて長いトラジェクトリ(例:1か月あたり240万ステップ)に起因する。
  • 訓練とテストの間での市場トレンドの変化やデータ分布のシフトに起因するHFTのパフォーマンス劣化を克服する。
  • 階層的分解と最適な価値の監視を用いて、変動が激しい暗号資産市場における強化学習エージェントの訓練効率とロバスト性を向上させる。
  • さまざまな市場環境(ボン、ベア、 sideways、リバウンド)においても高い収益性を維持できる安定的かつ適応的な取引システムを開発する。

提案手法

  • 第1段階では、将来の価格情報を用いて動的プログラミングによりQ-teacherを計算し、第二段階のRLエージェントの訓練効率とパフォーマンスを向上させる正則化子として機能させる。
  • 第2段階では、リターンレートの好み(例:ボン、ベア、 sideways)が異なる数百の第二段階RLエージェントを訓練し、最も収益性の高いエージェントのみを選び、多様な戦略プールを構成する。
  • 第3段階では、分単位のルータを強化学習で訓練し、現在の市場状況に応じてプール内の最も適切な第二段階エージェントを動的に選択する。
  • エージェントの訓練および選択に使用するため、市場トレンドを分類し、データセットにラベルを付けるためにDTW(動的時間ワープング)を用いる。
  • 収束の加速と最終パフォーマンスの向上を図るため、最適アクション価値監視(OS)と最適アクター(OA)を活用し、アブレーションスタディによりその影響を検証する。
  • 多様な市場環境下での複数の暗号資産(例:BTC、ETH、GALA)におけるパフォーマンス評価のため、高精細なシミュレーション環境を用いる。
Figure 1: The overview of EarnHFT. First, we compute a Q-teacher for enhancing the performance and training efficiency of second-level RL agents. Then, we efficiently train diverse RL agents under various market trends and select a small fraction of them to form an agent pool based on profitability.
Figure 1: The overview of EarnHFT. First, we compute a Q-teacher for enhancing the performance and training efficiency of second-level RL agents. Then, we efficiently train diverse RL agents under various market trends and select a small fraction of them to form an agent pool based on profitability.

実験結果

リサーチクエスチョン

  • RQ1極めて長いトラジェクトリを伴う高頻度取引において、階層的強化学習フレームワークは訓練効率とパフォーマンスの向上を図れるか?
  • RQ2トレンド別に最適化された多様なRLエージェントのプールは、変動が激しい暗号資産市場における市場環境の変化に伴うロバスト性をどのように向上させるか?
  • RQ3最適価値監視(Q-teacher)は、HFT用RLエージェントの収束をどの程度加速させ、最終的な収益性を向上させるか?
  • RQ4分単位でエージェントを動的に選択するルータは、静的または単一エージェントアプローチに比べて優れたパフォーマンスを発揮できるか?
  • RQ5Q-teacher、エージェントプール、およびルータの組み合わせは、最先端のベースラインと比較して収益性およびリスク調整リターンの点で優れているか?

主な発見

  • EarnHFTは、6つの最先端のベースラインを6つの金融指標で上回り、全テストデータセットで2番目に高い収益性を記録したエージェントを30%以上上回る収益性を達成した。
  • Q-teacher(OS)は、GALAデータセットにおいて収束までの訓練ステップ数を最大85%まで削減し、訓練効率を顕著に向上させた。
  • 最適アクター(OA)は、やや収束までの時間が長くなるが、最終リターンをさらに向上させるため、パフォーマンス向上の価値を示した。
  • ルータは、現在の市場トレンドに応じてエージェントを動的に選択することで優れたパフォーマンスを発揮した。選択分布は市場のボラティリティを反映しており、ETH や GALA のような高ボラティリティ市場ではよりバランスの取れた選択がなされた。
  • ポリシーに基づく手法(例:PPO、DRA)はベア市場で収束がダミー政策に陥るのに対し、ルールベース手法はストップロスおよびリターン目標パラメータに極めて敏感であった。
  • 価値に基づく手法(例:CDQRP、DQN)は安定したトレンド下でのみ良好に機能したが、EarnHFTは変動が激しくトレンドが変化する状況を含め、すべての市場環境で強力なパフォーマンスを維持した。
Figure 2: Trading process of EarnHFT in ETH
Figure 2: Trading process of EarnHFT in ETH

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。