Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution

Rundong Wang, Hongxin Wei|arXiv (Cornell University)|2020. 12. 23.
Advanced Bandit Algorithms Research참고 문헌 19인용 수 4
한 줄 요약

이 논문은 장기 수익을 최적화하면서 거래 비용(가격 슬리프지 등)을 최소화하기 위해 포트폴리오 관리와 주문 실행을 분리하는 계층적 강화학습 프레임워크인 HRPM을 제안한다. 시간 창 내에서 재균형 조정을 위한 고수준 정책과 실행을 위한 저수준 정책을 별도로 훈련시킴으로써, 미국 및 중국 주식시장에서 최신 기술 대비 뚜렷한 성능 향상을 달성하였으며, 연율 수익률 48.7%를 기록하고 위험 조정 지표에서도 뛰어난 성능을 보였다.

ABSTRACT

Portfolio management via reinforcement learning is at the forefront of fintech research, which explores how to optimally reallocate a fund into different financial assets over the long term by trial-and-error. Existing methods are impractical since they usually assume each reallocation can be finished immediately and thus ignoring the price slippage as part of the trading cost. To address these issues, we propose a hierarchical reinforced stock trading system for portfolio management (HRPM). Concretely, we decompose the trading process into a hierarchy of portfolio management over trade execution and train the corresponding policies. The high-level policy gives portfolio weights at a lower frequency to maximize the long term profit and invokes the low-level policy to sell or buy the corresponding shares within a short time window at a higher frequency to minimize the trading cost. We train two levels of policies via pre-training scheme and iterative training scheme for data efficiency. Extensive experimental results in the U.S. market and the China market demonstrate that HRPM achieves significant improvement against many state-of-the-art approaches.

연구 동기 및 목표

  • 기존 강화학습 기법이 가격 슬리프지를 忽시하고 즉각적인 실행을 전제로 하여 포트폴리오 관리에서의 한계를 해결하기 위해.
  • 실제 시장의 포트폴리오 매니저와 트레이더의 계층적 구조를 반영하기 위해 장기적 재균형 조정과 단기적 실행을 분리한 이중 수준의 의사결정 프로세스를 모델링하기 위해.
  • 엔트로피 정규화를 통한 반복적 훈련과 저수준 정책의 사전 훈련을 통해 데이터 효율성과 성능을 향상시키기 위해.
  • 다양한 시장 조건, 특히 고변동성 환경에서의 프레임워크의 우수성을 실증적으로 검증하기 위해.

제안 방법

  • HRPM은 거래 비용을 고려한 계층적 마르코프 결정 과정(HMDP)으로 포트폴리오 관리를 공식화하여 장기적인 포트폴리오 가중치 결정과 단기적 실행 행동을 분리한다.
  • 고수준 정책은 낮은 빈도로 작동하여 최적의 포트폴리오 가중치를 결정하고, 저수준 정책의 실행을 유도한다.
  • 저수준 정책은 행동 분기 기법을 활용해 다차원 행동(매수/매도 수량 및 가격)을 처리하며, 사전 훈련과 반복적 미세조정 방식으로 훈련된다.
  • 고수준 정책에 엔트로피 보너스를 도입하여 포트폴리오 다각화를 촉진하고 리스크 노출을 감소시킨다.
  • 한정된 주문호가 데이터를 활용하고, 슬리프지 포함한 실제 거래 비용을 보상 함수에 통합한다.
  • 실제 시장 적용성을 확보하기 위해 미국 및 중국 주식시장의 역사적 가격 및 한정주문호 데이터를 기반으로 훈련을 수행한다.

실험 결과

연구 질문

  • RQ1계층적 강화학습 프레임워크는 장기적 포트폴리오 최적화와 단기적 주문 실행을 효과적으로 분리하여 거래 비용을 줄일 수 있는가?
  • RQ2가격 슬리프지는 거래 비용의 무시할 수 없는 구성 요소로서, 현실적인 성능을 위해 명시적으로 모델링되어야 하는가?
  • RQ3고수준 정책에 엔트로피 보너스를 통합하면 리스크 다각화와 포트폴리오 전체의 안정성이 향상되는가?
  • RQ4다양한 시장 제도에서 HRPM은 수익률, 위험 조정 성과, 내구성 측면에서 최신 기술 대비 어떻게 비교되는가?
  • RQ5저수준 정책의 사전 훈련과 반복적 미세조정은 데이터 효율성과 전체 시스템 성능 향상에 어느 정도 기여하는가?

주요 결과

  • 중국 시장에서 HRPM은 연율 수익률 48.742%를 기록하여, 이어지는 최고의 베이스라인(DPM)보다 13% 높고, 시장 지수(SSE50)보다 42% 높았다.
  • 미국 시장에서는 엔트로피 보너스 계수 η=0.05일 때 연율 수익률 27.089%를 기록하여, 테스트된 모든 설정 중에서 최고 수준이었다.
  • HRPM은 뛰어난 리스크 통제 성능을 보였으며, 미국 시장에서 최소 최대 손실(MDD) 0.117을 기록했고, 변동성 높은 환경에서도 우수한 성능 유지를 보였다.
  • 제거 분석을 통해 수수료만으로는 총 거래 비용을 충분히 반영할 수 없음을 확인했으며, 특히 대규모 거래에서 슬리프지가 주요 구성 요소임을 입증했다.
  • 엔트로피 보너스는 위험 조정 수익률을 크게 향상시켰으며, η=0.05일 때 가장 높은 ARR를 기록했고, η=0.1일 때는 가장 낮은 MDD를 기록하여 효과적인 리스크 다각화를 입증했다.
  • 저수준 정책 행동의 시각적 분석 결과, 정책은 가격 정점에서 전략적으로 매도하고 국소 저점에서 매수함으로써 악성 가격 영향을 최소화하고 실행 품질을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.