[논문 리뷰] DeepScalper: A Risk-Aware Reinforcement Learning Framework to Capture Fleeting Intraday Trading Opportunities
DeepScalper는 이중 Q-네트워크와 액션 분기, 후행 보상 함수, 인코더-디코더 아키텍처를 통한 다중 모odal 시장 표현 방식, 변동성 예측 보조 작업을 조합한 위험 인지 강화학습 프레임워크로, 6개의 금융 선물에서 총 수익, 샤프 지수, 위험 조정 수익성 측면에서 최신 기준 기준선을 크게 능가한다.
Reinforcement learning (RL) techniques have shown great success in many challenging quantitative trading tasks, such as portfolio management and algorithmic trading. Especially, intraday trading is one of the most profitable and risky tasks because of the intraday behaviors of the financial market that reflect billions of rapidly fluctuating capitals. However, a vast majority of existing RL methods focus on the relatively low frequency trading scenarios (e.g., day-level) and fail to capture the fleeting intraday investment opportunities due to two major challenges: 1) how to effectively train profitable RL agents for intraday investment decision-making, which involves high-dimensional fine-grained action space; 2) how to learn meaningful multi-modality market representation to understand the intraday behaviors of the financial market at tick-level. Motivated by the efficient workflow of professional human intraday traders, we propose DeepScalper, a deep reinforcement learning framework for intraday trading to tackle the above challenges. Specifically, DeepScalper includes four components: 1) a dueling Q-network with action branching to deal with the large action space of intraday trading for efficient RL optimization; 2) a novel reward function with a hindsight bonus to encourage RL agents making trading decisions with a long-term horizon of the entire trading day; 3) an encoder-decoder architecture to learn multi-modality temporal market embedding, which incorporates both macro-level and micro-level market information; 4) a risk-aware auxiliary task to maintain a striking balance between maximizing profit and minimizing risk. Through extensive experiments on real-world market data spanning over three years on six financial futures, we demonstrate that DeepScalper significantly outperforms many state-of-the-art baselines in terms of four financial criteria.
연구 동기 및 목표
- 고차원적이고 세밀한 액션 공간에서의 순간적인 일일 거래 기회를 포착하는 데 도전 과제를 해결하기 위해.
- 마이크로 수준과 매크로 수준의 시장 데이터를 통합하여 의미 있는 다중 모달 시장 표현을 학습하기 위해.
- 보상 함수에 후행 보상 요소를 통합하여 장기적 의사결정 능력을 향상시키기 위해.
- 변동성 예측 보조 작업을 통해 훈련 안정성과 위험 인지 능력을 향상시키기 위해.
- 훈련 중 특정 자산에 대한 노출이 제한된 상황에서도 다양한 금융 상품에 대해 강건한 일반화를 달성하기 위해.
제안 방법
- 고차원적 일일 거래 액션 공간에서 강화학습 에이전트의 훈련을 효율적으로 최적화하기 위해 이중 Q-네트워크와 액션 분기 기법을 사용한다.
- 후행 보상 요소를 포함한 새로운 보상 함수는 에이전트가 하루 종일의 가격 추세를 고려하도록 유도하여 장기적 수평 의사결정을 촉진한다.
- 인코더-디코더 아키텍처를 통해 마이크로 수준의 오더북 데이터와 매크로 수준의 가격 추세를 융합하여 시간적 시장 임베딩을 학습한다.
- 위험 인지 보조 작업을 통해 훈련 중 수익 극대화와 위험 최소화를 균형 있게 조절한다.
- 실제 틱 레벨 데이터를 사용해 6개의 금융 선물(두 개의 주식 인덱스와 네 개의 국채 채권)에 대해 엔드 투 엔드로 훈련한다.
- 후행 보상의 수평 범위와 보조 작업 가중치와 같은 하이퍼파rameter는 성능 최적화를 위해 분석 실험을 통해 조정된다.
실험 결과
연구 질문
- RQ1고차원적이고 세밀한 액션 공간에서의 일일 거래에 대해 강화학습 에이전트를 효과적으로 훈련시키는 방법은 무엇인가?
- RQ2보상 함수에 후행 보상 요소를 통합할 경우, 장기적 일일 거래 성능에 얼마나 큰 영향을 미치는가?
- RQ3마이크로 수준과 매크로 수준의 데이터를 통합한 다중 모달 시장 표현 방식이 에이전트의 일일 시장 역학 이해도를 향상시키는가?
- RQ4변동성 예측 보조 작업을 통합할 경우, 훈련 안정성과 위험 조정 수익성에 어떤 영향을 미치는가?
- RQ5훈련 중 해당 자산의 데이터에 노출되지 않은 상황에서도 DeepScalper는 예측 불가능한 금융 상품에 대해 잘 일반화되는가?
주요 결과
- DeepScalper는 모든 6개의 금융 선물에서 모든 기준선 대비 최고의 총 수익률을 기록했으며, 일부 사례에서는 다음으로 좋은 방법보다 20~30% 높은 성능을 보였다.
- 후행 보상 요소를 적용한 에이전트는 장기적 수평 인식 능력이 뛰어나 하루 종일의 하락 추세를 조기에 대규모 숏 포지션을 취해 포착했다.
- 위험 인지 보조 작업 덕분에 여러 랜덤 시드에 걸쳐 성과 변동성이 감소했으며, 모든 6개 자산에서 총 수익률과 샤프 지수의 표준편차가 낮아졌다.
- 프레임워크는 예측 불가능한 금융 상품에 대해 강건한 일반화를 보였다: DeepScalper는 TF02 데이터만으로 훈련되었지만 T02 선물에서도 일관되게 뛰어난 성능을 보였으며, MV, GRU, LGBM과는 달리 성능 저하 없이 작동했다.
- 분석 실험 결과, 액션 분기, 후행 보상, 다중 모달 인코딩, 위험 보조 작업 등 각 구성 요소가 전체 성능 향상에 기여하고 있음을 확인했다.
- 최적의 후행 수평은 180 시간 단위(약 30분)로 확인되었으며, 이를 초과하면 장기 신호에 과적합되어 성능이 떨어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.