Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Cryptocurrency Trading: Practical Approach to Address Backtest Overfitting

Berend J.D. Gort, Xiaoyang Liu|arXiv (Cornell University)|Sep 12, 2022
Financial Markets and Investment Strategies被引用数 7
ひとこと要約

本稿は、暗号通貨取引におけるバックテスト過適合の検出と除外を目的とした仮説検定フレームワークを提案する。組み合わせ的交差検証とロジットに基づく統計的検定を用いて過適合の確率を推定することで、耐性のあるエージェントを特定する。PPOは累積リターンでベンチマークを24%上回り、2022年5月~6月の2回の市場崩壊期においても低いボラティリティを示した。

ABSTRACT

Designing profitable and reliable trading strategies is challenging in the highly volatile cryptocurrency market. Existing works applied deep reinforcement learning methods and optimistically reported increased profits in backtesting, which may suffer from the false positive issue due to overfitting. In this paper, we propose a practical approach to address backtest overfitting for cryptocurrency trading using deep reinforcement learning. First, we formulate the detection of backtest overfitting as a hypothesis test. Then, we train the DRL agents, estimate the probability of overfitting, and reject the overfitted agents, increasing the chance of good trading performance. Finally, on 10 cryptocurrencies over a testing period from 05/01/2022 to 06/27/2022 (during which the crypto market crashed two times), we show that the less overfitted deep reinforcement learning agents have a higher return than that of more overfitted agents, an equal weight strategy, and the S&P DBM Index (market benchmark), offering confidence in possible deployment to a real market.

研究の動機と目的

  • DRLベースの暗号通貨取引戦略におけるバックテスト過適合という深刻な問題に対処し、誤ったパフォーマンス主張を防ぐ。
  • 標準的なバックテスト検証を超えて、DRLエージェントの一般化能力を評価する実用的で定量的な手法を開発する。
  • 過適合確率が高すぎるエージェントを排除することでモデルの信頼性を向上させ、実市場への導入に自信を持つ。
  • 市場変動が激しい状況下で、過適合が少ないエージェントが従来手法や市場インデックスよりも優れたリスク調整リターンを達成することを実証する。

提案手法

  • バックテスト過適合の検出を統計的仮説検定として定式化し、帰無仮説は「過適合なし」、対立仮説は「過適合あり」とする。
  • 組み合わせ的交差検証を用いて多様な市場環境をシミュレートし、イン-sample(IS)性能とアウト・オブ・サンプル(OOS)性能の分布を分析することで、過適合の確率を推定する。
  • 各フォールドにおけるOOS性能の相対順位にロジット変換を適用し、過適合の確率をモデル化する。ロジット値が高くなるほど一般化性能が優れていることを示す。
  • 有意水準α(例:10%)を設定し、推定された過適合確率がこの値を超えるエージェントは拒否する。これにより、耐性のあるエージェントのみが保持される。
  • 同じデータ分割とハイパーパramーターサーチスペースを用いて、複数のDRLエージェント(PPO、TD3、SAC)を訓練・評価し、過適合リスクとパフォーマンスを比較する。
  • 動的リスク制御メカニズムを統合:CVIXインジケーターが90を超えると、エージェントは買いを停止し、全ポジションを清算してドローダウンを制限する。

実験結果

リサーチクエスチョン

  • RQ1統計的仮説検定は、DRLベースの暗号通貨取引エージェントにおけるバックテスト過適合を効果的に検出できるか?
  • RQ2異なるDRLアルゴリズムおよびハイパーパramータ設定において、過適合確率と実際のアウト・オブ・サンプルパフォーマンスの相関関係は何か?
  • RQ3過適合確率が低いと推定されるエージェントは、実際の市場ストレスイベント中において、より高い累積リターンと低いボラティリティを達成するか?
  • RQ4組み合わせ的交差検証は、金融分野のDRLタスクにおける過適合検出において、従来のウォークフォワードおよびK-フォールド交差検証を上回る性能を示すか?
  • RQ5過適合確率とDRLエージェントの耐性の間に一貫した関係があるか、特に市場崩壊期にその関係が明確に現れるか?

主な発見

  • 本稿で提案された組み合わせ的交差検証手法を用いて訓練されたPPOエージェントは、2022年5月~6月の期間に累積リターン-34.96%を達成し、S&P DBMインデックス(-50.78%)および等ウェート戦略(-47.78%)を著しく上回った。
  • PPOエージェントは全エージェントの中で最小のボラティリティ(2.01e-3)を示し、市場の混乱期における優れたリスク管理能力を示した。
  • PPOの過適合確率は8.0%と推定され、10%のしきい値を下回ったため、過適合していないエージェントとして受け入れられた。
  • SACエージェントは過適合確率が21.3%と最も高く、しきい値を超過したため、信頼性がないと判断され拒否された。
  • TD3はロジット値が約4に集中しており、インサンプルとアウト・オブ・サンプルのパフォーマンスに強い一貫性が確認され、耐性の高さが裏付けられた。
  • 本手法はPPOを最も信頼できるエージェントとして的確に特定した。PPOは次に優れたエージェント(TD3)よりも24%高い累積リターンを達成し、すべてのベンチマークより著しく優れたリスク調整パフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。