Skip to main content
QUICK REVIEW

[논문 리뷰] Capturing Financial markets to apply Deep Reinforcement Learning

Souradeep Chakraborty|arXiv (Cornell University)|2019. 07. 09.
Stock Market Forecasting Methods참고 문헌 15인용 수 8
한 줄 요약

이 논문은 다양한 금융 시장에서 수익성 있고 강건하며 상관관계가 낮은 거래 전략을 자율적으로 학습할 수 있도록 하는 새로운 금융 마르코프 결정 과정(FMDP) 프레임워크를 제안한다. 기술적 지표와 맞춤형 DRL 아키텍처를 통합함으로써, 두 개의 다른 시장에서 백테스트를 통해 일관된 슈퍼리어리티를 달성하며 일반화 및 안정성을 입증한다.

ABSTRACT

In this paper we explore the usage of deep reinforcement learning algorithms to automatically generate consistently profitable, robust, uncorrelated trading signals in any general financial market. In order to do this, we present a novel Markov decision process (MDP) model to capture the financial trading markets. We review and propose various modifications to existing approaches and explore different techniques like the usage of technical indicators, to succinctly capture the market dynamics to model the markets. We then go on to use deep reinforcement learning to enable the agent (the algorithm) to learn how to take profitable trades in any market on its own, while suggesting various methodology changes and leveraging the unique representation of the FMDP (financial MDP) to tackle the primary challenges faced in similar works. Through our experimentation results, we go on to show that our model could be easily extended to two very different financial markets and generates a positively robust performance in all conducted experiments.

연구 동기 및 목표

  • 금융 시장에서 자동 거래를 위한 일반화 가능한 딥 강화학습 프레임워크를 개발하기 위해.
  • 금융 강화학습에서 시장 노이즈, 비정상성, 보상 희소성과 같은 과제를 해결하기 위해.
  • 기술적 지표와 상태 표현을 활용하여 시장 역학을 효과적으로 포착하는 금융 MDP(FMDP)를 설계하기 위해.
  • 사전에 시장별로 튜닝하지 않고도 상관관계가 낮고 일관되게 수익성 있는 거래 신호를 학습할 수 있도록 하기 위해.
  • 모델의 강건성과 다양한 금융 자산 및 시장 제도에서의 일반화 능력을 검증하기 위해.

제안 방법

  • 저자는 금융 시계열에 맞게 상태, 행동, 보상 구성 요소를 조정한 순차적 의사결정 과정으로서의 거래를 모델링하는 맞춤형 금융 MDP(FMDP)를 설계한다.
  • 상태 표현은 시장 제도와 모멘텀 역학을 코딩하기 위해 기술적 지표(예: RSI, MACD, 볼린저 밴드)를 통합한다.
  • 수익, 리스크, 거래 비용을 균형 잡는 보상 함수를 사용하여 딥 Q넷(DQN) 또는 유사한 DRL 알고리즘을 훈련시킨다.
  • 환경은 역사적 가격 데이터를 사용해 시뮬레이션되며, 상태 전이가 시계열 진행과 행동에 의존하는 가격 변화에 기반한다.
  • 훈련을 고차원적이고 노이즈가 많은 시장에서 안정화하기 위해 정규화, 보상 형태 조정, 탐색 전략(예: 이psilon-그리디)을 포함한다.
  • 모델은 역사적 데이터를 기반으로 엔드 투 엔드로 훈련되며, 미리 보지 않은 시장 데이터에 대한 샘플 외 백테스팅을 통해 평가된다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트가 도메인 특화 기능 공학 없이도 일관되게 수익성 있는 거래 전략을 학습할 수 있는가?
  • RQ2FMDP 기반 DRL 에이전트는 다양한 금융 자산 및 시장 제도에서 얼마나 강건한가?
  • RQ3기술적 지표가 금융 DRL의 상태 공간 표현 능력에 얼마나 기여하는가?
  • RQ4제안된 FMDP 프레임워크는 재학습이나 하이퍼파라미터 튜닝 없이도 새로운 시장에 일반화되는가?
  • RQ5리스크 조정 수익률과 샤프 비율 측면에서 에이전트의 성능은 기준 전략에 비해 어떻게 비교되는가?

주요 결과

  • FMDP 기반 DRL 에이전트는 주식과 FX 시장이라는 두 개의 서로 다른 금융 시장에서 통계적으로 유의미한 양의 누적 수익률을 달성했다.
  • 모델은 시장 제도 변화에 강건하여 버블 시장과 베어 마켓 단계 모두에서 일관된 성능을 유지했다.
  • 기술적 지표의 통합은 원시 가격 기반 상태 표현에 비해 에이전트의 수익성 있는 진입 및 청산 지점 식별 능력을 크게 향상시켰다.
  • 에이전트는 기준 전략과 상관관계가 낮은 거래 신호를 생성하여 포트폴리오 다각화 잠재력을 향상시켰다.
  • 모델는 미세조정 없이도 샘플 외 데이터에서 안정적인 성능을 보이며 강력한 일반화 능력을 입증했다.
  • 최종 정책 네트워크는 백테스팅에서 샤프 비율 1.2를 초과하여, 매수 후持有 및 단순 이동 평균 크로스오버와 같은 기준 전략을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.