Skip to main content
QUICK REVIEW

[논문 리뷰] EarnHFT: Efficient Hierarchical Reinforcement Learning for High Frequency Trading

Molei Qin, Shuo Sun|arXiv (Cornell University)|2023. 09. 22.
Financial Markets and Investment Strategies인용 수 4
한 줄 요약

EarnHFT는 암호화자산 시장에서 고빈도 거래를 위한 세 단계의 계층적 강화학습 프레임워크를 제안한다. 이 프레임워크는 학습 효율성을 높이기 위해 Q-teacher를 사용하고, 추세별로 특화된 강화학습 에이전트의 다양한 풀을 구성하며, 분단위 라우터를 통해 최적의 에이전트를 동적으로 선택한다. 고정밀 시뮬레이션에서 여섯 가지 금융 지표를 기준으로 기존 최고 수준의 기준보다 최소 30% 높은 수익성을 달성한다.

ABSTRACT

High-frequency trading (HFT) uses computer algorithms to make trading decisions in short time scales (e.g., second-level), which is widely used in the Cryptocurrency (Crypto) market (e.g., Bitcoin). Reinforcement learning (RL) in financial research has shown stellar performance on many quantitative trading tasks. However, most methods focus on low-frequency trading, e.g., day-level, which cannot be directly applied to HFT because of two challenges. First, RL for HFT involves dealing with extremely long trajectories (e.g., 2.4 million steps per month), which is hard to optimize and evaluate. Second, the dramatic price fluctuations and market trend changes of Crypto make existing algorithms fail to maintain satisfactory performance. To tackle these challenges, we propose an Efficient hieArchical Reinforcement learNing method for High Frequency Trading (EarnHFT), a novel three-stage hierarchical RL framework for HFT. In stage I, we compute a Q-teacher, i.e., the optimal action value based on dynamic programming, for enhancing the performance and training efficiency of second-level RL agents. In stage II, we construct a pool of diverse RL agents for different market trends, distinguished by return rates, where hundreds of RL agents are trained with different preferences of return rates and only a tiny fraction of them will be selected into the pool based on their profitability. In stage III, we train a minute-level router which dynamically picks a second-level agent from the pool to achieve stable performance across different markets. Through extensive experiments in various market trends on Crypto markets in a high-fidelity simulation trading environment, we demonstrate that EarnHFT significantly outperforms 6 state-of-art baselines in 6 popular financial criteria, exceeding the runner-up by 30% in profitability.

연구 동기 및 목표

  • 매달 약 240만 단계에 이르는 매우 긴 경로로 인해 발생하는 고빈도 거래(HFT)의 학습 데이터 비효율성 문제를 해결한다.
  • 학습과 테스트 간의 시장 추세 변화 및 데이터 분포 변화로 인한 성능 저하 문제를 해결한다.
  • 계층적 분해와 최적의 가치 감독을 통해 변동성이 큰 암호화자산 시장에서 강화학습 에이전트의 학습 효율성과 강건성을 향상시킨다.
  • 상승장, 하락장, 횡보장, 조정장 등 다양한 시장 제도에서 높은 수익성을 유지하는 안정적이고 적응 가능한 거래 시스템을 개발한다.

제안 방법

  • 제1단계에서는 미래 가격 정보를 활용해 동적 프로그래밍을 통해 Q-teacher를 계산하여, 제2단계의 강화학습 에이전트의 학습 효율성과 성능을 향상시키는 정규화 기법으로 활용한다.
  • 제2단계에서는 다양한 수익률 선호도(예: 상승장, 하락장, 횡보장)를 가진 수백 개의 제2단계 강화학습 에이전트를 훈련하고, 수익성이 가장 높은 에이전트들만 선별하여 다양한 전략 풀을 구성한다.
  • 제3단계에서는 현재 시장 조건에 따라 풀 내의 가장 적합한 제2단계 에이전트를 동적으로 선택하기 위해 분단위 라우터를 강화학습으로 훈련시킨다.
  • 에이전트 훈련 및 선별을 위해 시장 추세를 분류하고 데이터셋을 레이블링하기 위해 DTW(Dynamic Time Warping)를 활용한다.
  • 수렴 가속화와 최종 성능 향상을 위해 최적 행동가치 감독(OS)과 최적 액터(OA)를 활용하며, 제거 실험을 통해 그 영향을 검증한다.
  • 다양한 암호자산(예: BTC, ETH, GALA)과 다양한 시장 제도에서 고정밀 시뮬레이션 환경을 활용해 성능을 평가한다.
Figure 1: The overview of EarnHFT. First, we compute a Q-teacher for enhancing the performance and training efficiency of second-level RL agents. Then, we efficiently train diverse RL agents under various market trends and select a small fraction of them to form an agent pool based on profitability.
Figure 1: The overview of EarnHFT. First, we compute a Q-teacher for enhancing the performance and training efficiency of second-level RL agents. Then, we efficiently train diverse RL agents under various market trends and select a small fraction of them to form an agent pool based on profitability.

실험 결과

연구 질문

  • RQ1매우 긴 경로를 가진 고빈도 거래에서 계층적 강화학습 프레임워크가 학습 효율성과 성능 향상에 기여할 수 있는가?
  • RQ2다양한 추세별로 특화된 강화학습 에이전트 풀은 변동성이 큰 암호화자산 시장에서 변화하는 시장 제도에 대해 얼마나 강건한가?
  • RQ3최적의 가치 감독(Q-teacher)이 고빈도 거래 강화학습 에이전트의 수렴 속도를 얼마나 가속화하고 최종 수익성을 얼마나 향상시키는가?
  • RQ4분단위로 에이전트를 동적으로 선택하는 라우터는 정적 또는 단일 에이전트 접근 방식에 비해 뛰어난 성능을 낼 수 있는가?
  • RQ5Q-teacher, 에이전트 풀, 라우터의 조합은 기존 최고 수준의 기준 대비 수익성과 리스크 조정 수익률 측면에서 어떻게 비교되는가?

주요 결과

  • EarnHFT는 여섯 가지 기준 금융 지표에서 기존 최고 수준의 기준보다 최소 30% 높은 수익성을 달성했으며, 모든 테스트 데이터셋에서 2위 기준보다 높은 성과를 기록했다.
  • Q-teacher(OS)는 GALA 데이터셋에서 수렴까지 필요한 학습 단계를 최대 85% 감소시켜 학습 효율성을 크게 향상시켰다.
  • 최적 액터(OA)는 수렴 시간이 약간 더 길어지더라도 최종 수익률을 더욱 높여 성능 향상에 기여하는 가치를 입증했다.
  • 라우터는 현재 시장 추세에 따라 에이전트를 동적으로 선택함으로써 뛰어난 성능을 달성했으며, 선택 분포가 시장 변동성에 따라 반영되었는데, ETH와 GALA와 같은 고변동성 시장에서는 더 균형 잡힌 선택을 보였다.
  • 정책 기반 방법(PPO, DRA 등)은 하락장에서 딜레마 정책으로 수렴하여 실패했고, 규칙 기반 방법은 정지손실 및 실현이익 설정값에 매우 민감했다.
  • 가치 기반 방법(CDQRP, DQN 등)은 안정된 추세에서만 잘 작동했지만, EarnHFT는 변동성과 추세 변화가 빈번한 조건에서도 강력한 성능을 유지했다.
Figure 2: Trading process of EarnHFT in ETH
Figure 2: Trading process of EarnHFT in ETH

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.