Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning for Cryptocurrency Trading: Practical Approach to Address Backtest Overfitting

Berend J.D. Gort, Xiaoyang Liu|arXiv (Cornell University)|2022. 09. 12.
Financial Markets and Investment Strategies인용 수 7
한 줄 요약

이 논문은 암호화폐 거래에서 백테스트 과적합된 딥 강화학습(DRL) 에이전트를 탐지하고 거부하기 위한 가설 검정 프레임워크를 제안한다. 조합적 교차검증과 로짓 기반 통계 검정을 통해 과적합 확률을 추정함으로써, 강건한 에이전트를 식별한다. PPO는 누적 수익률에서 벤치마크보다 24% 뛰어나며, 2022년 5월~6월 두 차례의 마켓 크래시 기간 동안 변동성도 낮게 유지되었다.

ABSTRACT

Designing profitable and reliable trading strategies is challenging in the highly volatile cryptocurrency market. Existing works applied deep reinforcement learning methods and optimistically reported increased profits in backtesting, which may suffer from the false positive issue due to overfitting. In this paper, we propose a practical approach to address backtest overfitting for cryptocurrency trading using deep reinforcement learning. First, we formulate the detection of backtest overfitting as a hypothesis test. Then, we train the DRL agents, estimate the probability of overfitting, and reject the overfitted agents, increasing the chance of good trading performance. Finally, on 10 cryptocurrencies over a testing period from 05/01/2022 to 06/27/2022 (during which the crypto market crashed two times), we show that the less overfitted deep reinforcement learning agents have a higher return than that of more overfitted agents, an equal weight strategy, and the S&P DBM Index (market benchmark), offering confidence in possible deployment to a real market.

연구 동기 및 목표

  • 백테스트 과적합 문제로 인한 허위 성과 주장 문제를 해결한다.
  • 표준 백테스트 검증을 넘어서 DRL 에이전트의 일반화 능력을 평가할 수 있는 실용적이고 정량적인 방법을 개발한다.
  • 과적합 확률이 높은 에이전트를 거부함으로써 모델 신뢰도를 향상시키고, 실제 시장 적용에 대한 자신감을 높인다.
  • 변동성이 큰 시장 조건에서 과적합 정도가 낮은 에이전트가 전통적 방법과 지수보다 뛰어난 리스크 조정 수익률을 달성함을 입증한다.

제안 방법

  • 백테스트 과적합 탐지를 통계적 가설 검정 문제로 재정의한다. 귀무가설은 과적합이 없다는 것이고, 대립가설은 과적합이 존재한다는 것이다.
  • 다양한 시장 제도를 시뮬레이션하기 위해 조합적 교차검증을 사용하고, 내측(내부) 성능(IS) 대비 외측 성능(OOS)의 분포를 분석함으로써 과적합 확률을 추정한다.
  • 각 폴드에서의 OOS 성능 상대 순위에 로짓 변환을 적용하여 과적합 확률을 모델링하며, 높은 로짓 값은 더 우수한 일반화 능력을 나타낸다.
  • 유의수준 α(예: 10%)를 설정하여, 추정된 과적합 확률이 이 값 이상인 에이전트는 기각함으로써 오직 강건한 에이전트만 유지한다.
  • 동일한 데이터 분할과 하이퍼파라미터 검색 공간을 사용하여 PPO, TD3, SAC 등의 다양한 DRL 에이전트를 훈련 및 평가함으로써 과적합 위험과 성능을 비교한다.
  • 동적 리스크 제어 메커니즘을 통합: CVIX 지표가 90를 초과할 경우, 에이전트는 매수를 중단하고 모든 포지션을 정리하여 극단적 변동성 기간 동안 손실을 제한한다.

실험 결과

연구 질문

  • RQ1통계적 가설 검정이 DRL 기반 암호화폐 거래 에이전트의 백테스트 과적합을 효과적으로 탐지할 수 있는가?
  • RQ2다양한 DRL 알고리즘과 하이퍼파라미터 설정에서 과적합 확률과 실제 외측 성능 간의 상관관계는 어떻게 되는가?
  • RQ3과적합 확률이 낮은 에이전트가 실제 시장 급락 기간 동안 더 높은 누적 수익률과 낮은 변동성을 달성하는가?
  • RQ4조합적 교차검증이 전통적인 워크포워드 및 K-폴드 교차검증보다 금융 DRL 과제에서 과적합을 탐지하는 데 더 우수한가?
  • RQ5시장 크래시 기간 동안 과적합 확률과 DRL 에이전트의 강건성 간에 일관된 관계가 존재하는가?

주요 결과

  • 제안된 조합적 교차검증 방법을 사용해 훈련된 PPO 에이전트는 2022년 5월~6월 기간 동안 누적 수익률 -34.96%를 기록했으며, S&P DBM 지수(-50.78%)와 등가중 전략(-47.78%)을 크게 앞서는 성과를 보였다.
  • PPO 에이전트는 모든 에이전트 중에서 가장 낮은 변동성(2.01e-3)을 기록하여 시장 혼란 기간 동안 뛰어난 리스크 제어 능력을 입증했다.
  • PPO의 과적합 확률은 8.0%로, 10% 기준선 이하이므로 과적합되지 않았다는 결론을 내리고 수용되었다.
  • SAC 에이전트는 과적합 확률이 21.3%로 기준선을 초과하여 신뢰할 수 없다고 판단되어 기각되었다.
  • TD3는 약 4에 집중된 로짓 값 분포를 보이며, 내측 성능와 외측 성능 간 높은 일관성을 보여 강건성을 뒷받침한다.
  • 제안된 방법은 PPO를 가장 신뢰할 수 있는 에이전트로 성공적으로 식별했으며, 다음으로 성능이 좋은 에이전트(TD3)보다 누적 수익률이 24% 높고, 모든 벤치마크보다 뚜렷이 뛰어난 리스크 조정 수익률을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.