[論文レビュー] Extending Deep Reinforcement Learning Frameworks in Cryptocurrency Market Making
本稿では、従来の時間的またはティックベースのイベントに代わり、価格変動に起因するイベントを用いる価格ベースのイベント駆動強化学習フレームワークを提案する。BitmexのLOBデータを用い、A2CおよびPPOアルゴリズムを適用した結果、特にTC報酬関数において利益と安定性が向上し、7つの報酬関数および30日間のOut-of-sampleテストにおいて、時間ベースのベースラインを上回った。
There has been a recent surge in interest in the application of artificial intelligence to automated trading. Reinforcement learning has been applied to single- and multi-instrument use cases, such as market making or portfolio management. This paper proposes a new approach to framing cryptocurrency market making as a reinforcement learning challenge by introducing an event-based environment wherein an event is defined as a change in price greater or less than a given threshold, as opposed to by tick or time-based events (e.g., every minute, hour, day, etc.). Two policy-based agents are trained to learn a market making trading strategy using eight days of training data and evaluate their performance using 30 days of testing data. Limit order book data recorded from Bitmex exchange is used to validate this approach, which demonstrates improved profit and stability compared to a time-based approach for both agents when using a simple multi-layer perceptron neural network for function approximation and seven different reward functions.
研究の動機と目的
- 強化学習による市場メイキングにおいて、遅延に敏感な時間的またはティックベースのイベント環境の限界を是正すること。
- エージェントが顕著な価格変動の際にのみ行動する、新たな価格ベースのイベント環境を提案・評価すること。
- 自動市場メイキングのための深層強化学習フレームワークにおいて、複数の報酬関数の性能を比較すること。
- 高頻度のLOBデータからのノイズを低減するより安定的で知的な戦略を有するDRLMMフレームワークを拡張すること。
提案手法
- 状態空間はレベルIIのLOBデータから導出され、注文フローインデックスや派生指標が含まれる。
- エージェントは、関数近似にマルチレイヤーパーセプトロンを用いた、ポリシーに基づく深層強化学習アルゴリズム(A2CおよびPPO)で訓練される。
- 環境は価格ベースのイベントによって定義され、価格変動がしきい値を超えた場合にのみアクションが発火する。これにより、顕著でないティックからのノイズが低減される。
- 7つの異なる報酬関数が評価された:UPnL、UPnLwF、Asym、AsymC、ΔRPnL、TC、DSR。各関数は、異なるリターン・リスクの目的に向かってエージェントの行動を形作る。
- トレーニングには8日間のBitmex LOBデータ(100万ステップ)が使用され、一般化および収益性を評価するため30日間のOut-of-sample評価が実施された。
- パフォーマンスは、複数の実験セットにおける累積リターン、損益、安定性指標によって測定された。
実験結果
リサーチクエスチョン
- RQ1価格ベースのイベント環境は、暗号資産市場メイキングにおけるエージェントの収益性および安定性について、時間的またはティックベースの環境と比較してどのように異なるか?
- RQ27つの報酬関数のうち、時間的および価格ベースのイベント設定の両方において、最も強固で収益性の高いトレーディング戦略を生み出すのはどれか?
- RQ3限られた歴史的データでトレーニングされたポリシーに基づく深層強化学習エージェントは、異なる市場環境に一般化できるか?
- RQ4価格しきい値によるイベント頻度の低減は、高頻度のLOB環境における学習効率を向上させ、不規則な取引行動を低減するか?
主な発見
- A2Cエージェントは、両方のイベントタイプにおいて累積リターンと収益性のある実験数の両面でPPOを上回った。
- TC(Target Completion)報酬関数は、時間的および価格ベースの両環境で最高のリターンを達成し、時間ベース環境下でのSet 3では17.61%のリターンを記録した。
- 価格ベースのイベントは、特に大きな価格ジャンプ時においてより安定した取引パターンを示し、ノイズに起因する不規則な行動を低減した。
- 価格ベースのイベントを用いた84回の実験のうち23回が収益性を示したが、時間ベース環境下ではそれより少ない収益性を示した。これは、学習効率の向上を示唆している。
- AsymC報酬関数は一部のセットで優れたパフォーマンスを示し、1回の価格ベース実験で11.88%のリターンを達成した。これは、非対称なリスク調整が効果的である可能性を示している。
- DSR(Differential Sharpe Ratio)報酬関数は混合結果を示し、大多数のケースで負のリターンを記録した。これは、高ボラティリティ環境下での不安定性の可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。