[논문 리뷰] Practical Deep Reinforcement Learning Approach for Stock Trading
저자들은 30주식 거래 환경에 DDPG를 적용하여 Dow Jones Industrial Average와 최소-분산 포트폴리오보다 Sharpe 비율과 누적 수익이 더 높다.
Stock trading strategy plays a crucial role in investment companies. However, it is challenging to obtain optimal strategy in the complex and dynamic stock market. We explore the potential of deep reinforcement learning to optimize stock trading strategy and thus maximize investment return. 30 stocks are selected as our trading stocks and their daily prices are used as the training and trading market environment. We train a deep reinforcement learning agent and obtain an adaptive trading strategy. The agent's performance is evaluated and compared with Dow Jones Industrial Average and the traditional min-variance portfolio allocation strategy. The proposed deep reinforcement learning approach is shown to outperform the two baselines in terms of both the Sharpe ratio and cumulative returns.
연구 동기 및 목표
- 투자 수익을 극대화하기 위해 주식 거래를 마르코프 결정 프로세스(MDP)로 동기화하고 형식화한다.
- 거래에서 큰 상태 공간과 행동 공간을 다루기 위해 딥 강화 학습 접근법(DDPG)을 제안한다.
- 과거 주가 데이터에서 적응형 거래 성과를 시연하고 기준선과 비교한다.
- 다양한 금융 지표(수익률, 변동성, 샤프 비율)로 수익성과 위험을 평가한다.
제안 방법
- 상태 s = [p, h, b], 행동 a를 D 주식에 걸쳐, 보상 r(s,a,s')로 주식 거래를 MDP로 모델링한다.
- 액터-크리틱 아키텍처를 갖춘 Deep Deterministic Policy Gradient (DDPG)을 사용하여 상태를 행동으로 매핑한다.
- 훈련 안정화 및 샘플의 상관관계 제거를 위해 경험 재생 버퍼 및 타깃 네트워크를 도입한다.
- 2009–2018년의 과거 데이터(30개 DJIA 주식)에서 학습/검증/거래 워크플로우로 훈련 및 검증한다.
- 최종 포트폴리오 가치, 연환산 수익률, 연환산 표준오차, 샤프 비율을 사용하여 성과를 평가한다.
- DDPG 학습 루프의 업데이트 규칙(Q 및 μ)에 대한 자세한 Algorithm 1을 제공한다.
실험 결과
연구 질문
- RQ1DDPG 기반 거래 전략이 과거 데이터에서 Dow Jones Industrial Average와 최소-분산 포트폴리오를 능가하는가?
- RQ2주식 거래에 DDPG를 사용할 때의 수익 및 위험 조정 성과(샤프 비율) 향상은 어느 정도인가?
- RQ330종 주식으로 학습, 검증, 실제 거래와 유사한 단계에서 제안된 방법의 성능은 어떠한가?
주요 결과
- DDPG는 최종 포트폴리오 가치를 Min-Variance(14,369) 및 DJIA(15,428)보다 높은 19,791을 달성한다.
- DDPG의 연환산 수익률은 Min-Variance(15.93%) 및 DJIA(16.40%)보다 더 높다 25.87%.
- DDPG의 연환산 표준 오차는 Min-Variance(9.97%) 및 DJIA(11.70%)보다 높다 13.62%.
- DDPG의 샤프 비율은 1.79로 Min-Variance(1.45)와 DJIA(1.27)보다 높다.
- 결과는 DDPG 기반 거래 전략이 수익과 위험 균형 모두에서 벤치마크를 능가할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.