Skip to main content
QUICK REVIEW

[논문 리뷰] PRUDEX-Compass: Towards Systematic Evaluation of Reinforcement Learning in Financial Markets

Shuo Sun, Molei Qin|arXiv (Cornell University)|2023. 01. 14.
Stock Market Forecasting MethodsDecision Sciences인용 수 3
한 줄 요약

이 논문은 금융 시장에서 강화학습을 위한 체계적인 6축 평가 프레임워크인 PRUDEX-Compass를 소개한다. 이 프레임워크는 수익성, 리스크 제어, 포괄성, 다양성, 신뢰성, 설명 가능성의 17개 지표를 포함한다. 또한 기존 FinRL 베이스라인을 초월하는 성능을 보이는 믹스처 오브 엑스퍼트와 리스크 인지 강화학습 기법인 AlphaMix+를 제안하며, 장기적인 실세계 데이터셋에서 모든 축에서 뛰어난 성능을 발휘한다. 또한 신뢰할 수 있는 FinRL 연구 및 구현을 가속화하기 위해 오픈소스 도구를 공개한다.

ABSTRACT

The financial markets, which involve more than $90 trillion market capitals, attract the attention of innumerable investors around the world. Recently, reinforcement learning in financial markets (FinRL) has emerged as a promising direction to train agents for making profitable investment decisions. However, the evaluation of most FinRL methods only focuses on profit-related measures and ignores many critical axes, which are far from satisfactory for financial practitioners to deploy these methods into real-world financial markets. Therefore, we introduce PRUDEX-Compass, which has 6 axes, i.e., Profitability, Risk-control, Universality, Diversity, rEliability, and eXplainability, with a total of 17 measures for a systematic evaluation. Specifically, i) we propose AlphaMix+ as a strong FinRL baseline, which leverages mixture-of-experts (MoE) and risk-sensitive approaches to make diversified risk-aware investment decisions, ii) we evaluate 8 FinRL methods in 4 long-term real-world datasets of influential financial markets to demonstrate the usage of our PRUDEX-Compass, iii) PRUDEX-Compass together with 4 real-world datasets, standard implementation of 8 FinRL methods and a portfolio management environment is released as public resources to facilitate the design and comparison of new FinRL methods. We hope that PRUDEX-Compass can not only shed light on future FinRL research to prevent untrustworthy results from stagnating FinRL into successful industry deployment but also provide a new challenging algorithm evaluation scenario for the reinforcement learning (RL) community.

연구 동기 및 목표

  • 기존 FinRL 방법들이 수익 지표에 집중하면서 리스크, 신뢰성, 설명 가능성 등을 간과하는 체계적 평가의 부족을 해결하기 위해.
  • 다양한 핵심 금융 성과 차원에서 FinRL 알고리즘 간의 공정하고 신뢰할 수 있는 비교를 가능하게 하는 종합적 벤치마크를 개발하기 위해.
  • 실세계 거래 전략을 모방하고 모든 평가 축에서 시장 평균을 초월하는 강력하고 견고한 베이스라인(AlphaMix+)을 제공하기 위해.
  • 재현 가능하고 산업용으로 활용 가능한 FinRL 연구를 가속화하기 위해 오픈소스 데이터셋, 코드, 환경, 시각화 도구를 공개하기 위해.

제안 방법

  • 수익성, 리스크 제어, 포괄성, 다양성, 신뢰성, 설명 가능성의 6축 평가 프레임워크인 PRUDEX-Compass를 설계하며, 17개의 별도 성능 측정 지표를 포함한다.
  • 동적 정책 특화와 리스크 민감한 벨먼 백업을 통해 강건성을 향상시키기 위해 믹스처 오브 엑스퍼트 아키텍처를 사용하는 딥 강화학습 에이전트인 AlphaMix+를 제안한다.
  • 표준화된 포트폴리오 관리 환경을 구현하고, 15년 이상의 장기적인 실세계 금융 데이터셋 4종을 통합한다.
  • 다양한 거래 작업에서 8종의 FinRL 방법(AlphaMix+ 포함)을 대상으로 체계적 평가를 적용하여 프레임워크의 유용성과 강건성을 검증한다.
  • 재현 가능성을 지원하고 커뮤니티의 채택을 촉진하기 위해 시각화 툴킷과 공개 GitHub 리포지터리를 개발한다.
  • 변동성 인지 학습과 다목적 강화학습과 같은 보조 기법을 통합하여 모델이 극단적인 시장 조건을 더 잘 인지할 수 있도록 한다.
Figure 1 : Illustration of our FinRL methods evaluation benchmark PRUDEX-Compass. The inner star plot provides a visual indication of the relative strength of different FinRL methods in terms of six axes. A mark on the star plot’s inner circle suggests the market average 3 3 3 Market average indicat
Figure 1 : Illustration of our FinRL methods evaluation benchmark PRUDEX-Compass. The inner star plot provides a visual indication of the relative strength of different FinRL methods in terms of six axes. A mark on the star plot’s inner circle suggests the market average 3 3 3 Market average indicat

실험 결과

연구 질문

  • RQ1기존 FinRL 방법들은 수익성 이외의 차원, 예를 들어 리스크 제어, 신뢰성, 설명 가능성에서 어떻게 성능을 발휘하는가?
  • RQ2단일 FinRL 에이전트가 변동성 높거나 변화하는 시장 제도에서 강건성을 희생시키지 않고 PRUDEX-Compass의 모든 6축에서 뛰어난 성능을 달성할 수 있는가?
  • RQ3AlphaMix+는 리스크 조정 수익률, 적응 가능성, 해석 가능성 측면에서 기존 FinRL 베이스라인을 얼마나 뛰어나게 성과를 내는가?
  • RQ4PRUDEX-Compass는 백테스트에서만 잘 성과를 내는 모델의 과적합과 일반화 부족을 얼마나 효과적으로 식별하는가?
  • RQ5이 프레임워크는 비-RL 방법 및 금융 분야의 더 넓은 기계학습 응용 분야로 일반화될 수 있는가?

주요 결과

  • AlphaMix+는 PRUDEX-Compass의 모든 6축에서 다른 7개의 FinRL 방법을 뛰어넘어 수익성, 리스크 제어, 설명 가능성에서 뛰어난 성능을 발휘한다.
  • 평가 결과, SAC 및 Imit 등 많은 기존 FinRL 방법들이 강력한 백테스트 수익을 내지만, 블랙스완 사건 기간 동안 악성 리스크 제어와 치명적인 손실을 겪는다는 점이 드러났다.
  • PRUDEX-Compass는 수익 추구 에이전트의 과적합과 강건성 부족을 성공적으로 식별하여, 실세계 구현 이전에 신뢰할 수 없는 방법을 걸러내는 데서 그 가치를 입증한다.
  • 이 프레임워크는 시장 제도 변화 상황에서의 성능 저하를 탐지할 수 있었으며, 실세계 응용에서 포괄성과 신뢰성의 중요성을 부각시켰다.
  • 데이터셋, 코드, 시각화 도구의 오픈소스 공개는 이미 재현 가능성과 벤치마크를 촉진했으며, AlphaMix+는 향후 FinRL 연구를 위한 새로운 강력한 베이스라인으로 기능하고 있다.
  • 제거 실험 결과, AlphaMix+의 뛰어난 성능을 이끌어낸 믹스처 오브 엑스퍼트 및 리스크 인지 벨먼 백업 구성 요소가 모두 필수적임을 확인했다.
Figure 2 : Workflow of real-world trading firms.
Figure 2 : Workflow of real-world trading firms.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.