[論文レビュー] Deep Reinforcement Learning for Trading
本論文は、複数の資産クラスにまたがる連続先物契約の最適トレーディング戦略を学習するための深層強化学習(DRL)フレームワークを提案する。DQN、PG、A2Cアルゴリズムを用いて市場状態を直接取引ポジションにマッピングし、ボラティリティスケーリングされた報酬を導入することで、古典的なモーメンタム戦略を上回り、取引コストが高額であっても正のリスク調整リターンを達成する。商品、株式、債券、外国為替市場において、安定したパフォーマンスを示す。
We adopt Deep Reinforcement Learning algorithms to design trading strategies for continuous futures contracts. Both discrete and continuous action spaces are considered and volatility scaling is incorporated to create reward functions which scale trade positions based on market volatility. We test our algorithms on the 50 most liquid futures contracts from 2011 to 2019, and investigate how performance varies across different asset classes including commodities, equity indices, fixed income and FX markets. We compare our algorithms against classical time series momentum strategies, and show that our method outperforms such baseline models, delivering positive profits despite heavy transaction costs. The experiments show that the proposed algorithms can follow large market trends without changing positions and can also scale down, or hold, through consolidation periods.
研究の動機と目的
- 市場状態から直接最適な取引ポジションを学習する深層強化学習フレームワークの開発。明示的な予測を回避する。
- DQN、PG、A2CといったDRLアルゴリズムが、離散的および連続的アクションスペースを有する多様な先物市場に与える有効性の調査。
- ボラティリティスケーリングを用いた報酬関数の改善により、市場ボラティリティに応じてポジションサイズを動的に調整する。
- 取引コストが現実的である状況下で、資産クラス(商品、株価指数、債券、外国為替)にわたるパフォーマンスの評価。
- トレンド市場および平均回帰市場の両方において、DRLベースの戦略の強靭性と一貫性の実証。
提案手法
- 市場状態をエンコードするための状態表現として、時系列モーメンタムおよびテクニカルインジケーター(例:MACD、リターンの符号)を用いる。
- 3つのDRLアルゴリズムを採用:ディープQネットワーク(DQN)、ポリシー勾配(PG)、アドバンテージアクターキャリブレーター(A2C)、両方のアクションスペース(離散的および連続的)を対応可能に。
- 報酬関数にボラティリティスケーリングを導入し、ボラティリティが低い場合にはポジションサイズを増加、高い場合には縮小する。
- 効用関数は線形(リスク中立的)であり、強化学習の目的である期待累積リターンの最大化と整合する。現代ポートフォリオ理論とも整合的である。
- 取引コストは報酬関数に明示的に組み込み、現実の市場摩擦を反映する。
- パフォーマンスは2011年から2019年までの50の流動性の高い先物契約を用いて評価され、シャープレシオや1トーンの平均リターンといった指標が使用された。
実験結果
リサーチクエスチョン
- RQ1深層強化学習アルゴリズムは、明示的な予測を伴わずに、市場状態から利益を上げるトレーディング戦略を直接学習できるか?
- RQ2離散的および連続的アクションスペースを有するDRLモデルは、異なる資産クラスにおいてどのようにパフォーマンスを発揮するか?
- RQ3報酬関数におけるボラティリティスケーリングは、トレーディングパフォーマンスおよび強靭性をどの程度向上させるか?
- RQ4DRLベースの戦略は、高い取引コスト下でも、古典的な時系列モーメンタム戦略を上回ることができるか?
- RQ5個々の契約および資産クラスにわたって、結果はどの程度一貫性を示すか?
主な発見
- DRLベースの戦略、特にDQNとA2Cは、すべての資産クラスにおいて古典的なモーメンタム戦略を上回り、正の年間シャープレシオを達成した。
- DQNは全契約平均で年間シャープレシオ1.288を達成し、累積リターン2.220を記録した。25ベーシスポイントの取引コスト下でも同様のパフォーマンスを示した。
- A2Cアルゴリズムは累積リターン1.785、年間シャープレシオ1.050を達成し、トレンド市場における強力なパフォーマンスを示した。
- 商品、株価指数、債券、外国為替市場の各分野において、モデルは一貫したパフォーマンスを維持し、分野ごとのシャープレシオは0.517から1.048の範囲に収まった。
- 25bpの取引コスト(1契約あたり約3.5ドルに相当)下でも、DQNとA2Cは正の利益を上げ続け、市場摩擦に対して強靭であることを示した。
- ボックスプロット分析により、パフォーマンスが1つの高パフォーマンス契約に依存しているわけではないことが確認され、個々の証券にわたるモデルの一貫性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。