Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Portfolio Management

Angelos Filos|arXiv (Cornell University)|2019. 09. 12.
Stock Market Forecasting Methods참고 문헌 64인용 수 9
한 줄 요약

이 논문은 다양한 금융 자산과 시장에서 보편적인 포트폴리오 관리에 적합한 모델 프리 강화학습 에이전트—특히 딥 소프트 순환 Q-네트워크(Deep Soft Recurrent Q-Networks, DSRQN)와 스코어 머신의 믹스(Mixture of Score Machines, MSM)—를 제안한다. 데이터 증강과 사전 훈련을 활용하여, 이 에이전트들은 전이 비용과 비정상적인 시장 조건 하에서도 최신 기술 수준의 모델보다 최대 9.2% 높은 연간 누적 수익률과 13.4% 높은 연간 샤프 지수를 기록한다.

ABSTRACT

In this thesis, we develop a comprehensive account of the expressive power, modelling efficiency, and performance advantages of so-called trading agents (i.e., Deep Soft Recurrent Q-Network (DSRQN) and Mixture of Score Machines (MSM)), based on both traditional system identification (model-based approach) as well as on context-independent agents (model-free approach). The analysis provides conclusive support for the ability of model-free reinforcement learning methods to act as universal trading agents, which are not only capable of reducing the computational and memory complexity (owing to their linear scaling with the size of the universe), but also serve as generalizing strategies across assets and markets, regardless of the trading universe on which they have been trained. The relatively low volume of daily returns in financial market data is addressed via data augmentation (a generative approach) and a choice of pre-training strategies, both of which are validated against current state-of-the-art models. For rigour, a risk-sensitive framework which includes transaction costs is considered, and its performance advantages are demonstrated in a variety of scenarios, from synthetic time-series (sinusoidal, sawtooth and chirp waves), simulated market series (surrogate data based), through to real market data (S\&P 500 and EURO STOXX 50). The analysis and simulations confirm the superiority of universal model-free reinforcement learning agents over current portfolio management model in asset allocation strategies, with the achieved performance advantage of as much as 9.2\% in annualized cumulative returns and 13.4\% in annualized Sharpe Ratio.

연구 동기 및 목표

  • 재훈련 없이 다양한 금융 자산과 시장 간 일반화가 가능한 보편적이고 모델 프리 강화학습 에이전트를 개발하는 것.
  • 금융 시계열의 비정상성, 약한 역사적 연관성, 낮은 데이터량 문제를 데이터 증강과 사전 훈련을 통해 해결하는 것.
  • 거래 비용과 다양한 시장 제도를 포함한 위험 감수성 환경에서 이러한 에이전트의 성능을 평가하는 것.
  • 합성, 대체, 실제 시장 데이터에서 최신 기술 수준의 포트폴리오 최적화 모델과의 비교를 수행하는 것.

제안 방법

  • 순차적 자산 배분을 위한 모델 프리 강화학습 에이전트로 딥 소프트 순환 Q-네트워크(Deep Soft Recurrent Q-Networks, DSRQN)와 스코어 머신의 믹스(Mixture of Score Machines, MSM)를 활용하는 것.
  • 유효한 훈련 데이터 양을 늘리고 낮은 데이터 환경에서의 일반화 능력을 향상시키기 위해 생성적 접근 방식을 통한 데이터 증강을 적용하는 것.
  • 희소 수익률을 보이는 금융 시계열에서 학습 효율성과 수렴성을 향상시키기 위해 사전 훈련 전략을 구현하는 것.
  • 거래 비용을 강화학습 목표 함수에 명시적으로 반영하는 위험 감수성 프레임워크를 통합하는 것.
  • 다양한 금융 유니버스(S&P 500, EURO STOXX 50)에서 에이전트를 훈련하고, 예측 불가능한 자산과 시장으로의 일반화 능력을 평가하는 것.
  • 통제된 조건과 비정상적인 조건에서의 탄력성 검증을 위해 합성 시계열(사인파, 이쑤날파, 치르프)과 대체 데이터를 사용하는 것.

실험 결과

연구 질문

  • RQ1모델 프리 강화학습 에이전트는 재훈련 없이 다양한 금융 자산과 시장 간 일반화가 가능한가?
  • RQ2데이터 증강과 사전 훈련 전략이 낮은 수익률 데이터에서 성능 향상에 얼마나 기여하는가?
  • RQ3최신 기술 수준의 모델과 비교해 볼 때, 제안된 에이전트는 거래 비용을 포함한 위험 감수성 제약 조건 하에서 어떻게 성능을 내는가?
  • RQ4기존의 모델 기반 및 모델 프리 포트폴리오 최적화 방법에 비해 보편적 강화학습 에이전트는 어떤 성능 우위를 점하는가?
  • RQ5합성, 대체, 실제 시장 데이터에서 에이전트의 누적 수익률과 샤프 지수 측면에서 일반화 능력은 어떻게 평가되는가?

주요 결과

  • 제안된 모델 프리 강화학습 에이전트는 최신 기술 수준의 포트폴리오 관리 모델 대비 최대 9.2% 높은 연간 누적 수익률을 기록한다.
  • 에이전트는 연간 샤프 지수에서 13.4% 향상된 성과를 보이며, 이는 뛰어난 위험 조정 수익률을 의미한다.
  • 재훈련 없이도 S&P 500과 EURO STOXX 50를 포함한 다양한 금융 유니버스에서 효과적으로 일반화된다.
  • 위험 감수성 프레임워크에 거래 비용을 통합함으로써 탄력성과 실생활 적용 가능성이 크게 향상된다.
  • 데이터 증강과 사전 훈련 전략은 금융 시계열의 데이터 부족 문제를 효과적으로 완화하여 학습 안정성과 성능을 향상시킨다.
  • 합성, 대체, 실제 시장 데이터 전반에서 성능 우위가 일관되게 관찰되어, 이 방법의 탄력성과 보편성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.