Skip to main content
QUICK REVIEW

[논문 리뷰] Profitable Strategy Design by Using Deep Reinforcement Learning for Trades on Cryptocurrency Markets

Mohsen Asgari, Seyed Hossein Khasteh|arXiv (Cornell University)|2022. 01. 15.
Financial Markets and Investment Strategies인용 수 4
한 줄 요약

이 논문은 PPO, SAC, GAIL을 사용한 딥 강화학습 프레임워크를 제안하여 암호화폐 거래 전략을 설계한다. 커스터마이즈된 Gym 환경에서 가격 및 기술적 지표 데이터를 기반으로 훈련된 모델은 검증되지 않은 66일 간의 테스트 기간 동안 48.5%의 수익률(초기 투자 10,000달러 기준 4,850달러 수익)을 달성하였으며, 환경 설계 시 가변적인 리스크 조정 하이퍼파rameter를 포함하고 있다.

ABSTRACT

Deep Reinforcement Learning solutions have been applied to different control problems with outperforming and promising results. In this research work we have applied Proximal Policy Optimization, Soft Actor-Critic and Generative Adversarial Imitation Learning to strategy design problem of three cryptocurrency markets. Our input data includes price data and technical indicators. We have implemented a Gym environment based on cryptocurrency markets to be used with the algorithms. Our test results on unseen data shows a great potential for this approach in helping investors with an expert system to exploit the market and gain profit. Our highest gain for an unseen 66 day span is 4850 US dollars per 10000 US dollars investment. We also discuss on how a specific hyperparameter in the environment design can be used to adjust risk in the generated strategies.

연구 동기 및 목표

  • 암호화폐 시장에서 딥 강화학습을 활용한 전문 거래 시스템을 개발하기 위해.
  • 실제 암호화폐 가격 데이터에 대해 PPO, SAC, GAIL과 같은 다수의 딥 강화학습 알고리즘 성능을 평가하기 위해.
  • 가변적인 리스크 파ram터를 포함한 커스터마이즈된 Gym 기반 강화학습 환경을 설계하기 위해.
  • 훈련 중에 볼 수 없었던 시장 조건에서도 수익성 있고 일반화 가능한 거래 전략을 생성할 수 있는지 입증하기 위해.

제안 방법

  • 가격 데이터와 기술적 지표를 포함한 상태 공간을 갖는 커스터마이즈된 Gym 환경을 구현하여 암호화폐 거래를 시뮬레이션하였다.
  • 프록시 포리시 옵티마이제이션(PPO), 소프트 액터-크리틱(SAC), 생성적 적대적 암시 학습(GAIL)을 적용하여 최적의 거래 정책을 학습시켰다.
  • 상태 공간에는 과거의 가격과 RSI, MACD와 같은 기술적 지표를 포함하여 거래 결정을 지원하였다.
  • 액션 공간은 각 타임스텝에서 매수, 매도, 홀드 중 하나의 결정을 허용하였으며, 보상은 포트폴리오 수익률에 기반하였다.
  • 훈련 중에 에이전트의 리스크 노출을 조절하기 위해 환경 설계에 리스크 조정 하이퍼파rameter를 도입하였다.
  • 모델은 과거 데이터를 기반으로 훈련되었고, 별도로 분리된 검증되지 않은 66일 간의 테스트 기간을 통해 일반화 능력과 수익성 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1가격 및 기술적 지표 데이터만을 사용하여 딥 강화학습 에이전트가 암호화폐 시장에서 수익성 있는 거래 전략을 학습할 수 있는가?
  • RQ2PPO, SAC, GAIL이 암호화폐 거래 전략 생성에 적용되었을 때 성능 및 안정성 측면에서 어떻게 비교되는가?
  • RQ3환경 설계에 통합된 가변 하이퍼파rameter가 생성된 거래 전략의 리스크 프로파일을 효과적으로 제어할 수 있는가?
  • RQ4훈련 중에 볼 수 없었던 시장 조건에 대해 훈련된 에이전트가 과적합 없이 얼마나 잘 일반화되는가?
  • RQ5실제 암호화폐 데이터 기반으로 딥 강화학습 전략을 사용할 경우, 테스트 기간 동안 얼마나 많은 수익을 달성할 수 있는가?

주요 결과

  • 최고 성능을 보인 에이전트는 검증되지 않은 66일 간의 테스트 기간 동안 48.5%의 수익률을 기록하였으며, 이는 초기 투자 10,000달러 기준 4,850달러의 수익에 해당한다.
  • PPO, SAC, GAIL의 세 알고리즘이 모두 암호화폐 데이터 기반으로 수익성 있는 거래 정책을 학습하는 데 성공하였다.
  • 환경 설계에 통합된 가변 리스크 하이퍼파라미터 덕분에 생성된 전략의 리스크 노출을 체계적으로 조정할 수 있었다.
  • 모델는 훈련 중에 볼 수 없었던 데이터에서도 수익성을 유지하며 강력한 일반화 성능을 보였다.
  • 결과적으로 딥 강화학습은 암호화폐 시장에서 전문 거래 시스템을 구축하는 데 실용적인 방법임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.