Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforced Deep Markov Models With Applications in Automatic Trading

Tadeu Augusto Ferreira|arXiv (Cornell University)|2020. 11. 09.
Stock Market Forecasting Methods참고 문헌 27인용 수 4
한 줄 요약

이 논문은 알고리즘 거래에서 노이즈가 많고 완전하지 않은 시장 데이터를 다루기 위해 변분 autoencoder와 딥 마르코프 모델을 통합한 모델 기반 강화학습 프레임워크인 강화된 딥 마르코프 모델(RDMM)을 제안한다. 관측값을 필터링하고 상태 불확실성을 정책 학습에 통합함으로써 RDMM은 데이터 효율성과 금융 성능을 향상시키며, 페이스북, 인텔, 버즈퍼드, 마이크로소프트의 실제 리미트 오더북 데이터에서 Q-러닝, 다이나Q-ARIMA, 다이나Q-LSTM 기준선보다 뛰어난 성능을 보였다.

ABSTRACT

Inspired by the developments in deep generative models, we propose a model-based RL approach, coined Reinforced Deep Markov Model (RDMM), designed to integrate desirable properties of a reinforcement learning algorithm acting as an automatic trading system. The network architecture allows for the possibility that market dynamics are partially visible and are potentially modified by the agent's actions. The RDMM filters incomplete and noisy data, to create better-behaved input data for RL planning. The policy search optimisation also properly accounts for state uncertainty. Due to the complexity of the RKDF model architecture, we performed ablation studies to understand the contributions of individual components of the approach better. To test the financial performance of the RDMM we implement policies using variants of Q-Learning, DynaQ-ARIMA and DynaQ-LSTM algorithms. The experiments show that the RDMM is data-efficient and provides financial gains compared to the benchmarks in the optimal execution problem. The performance improvement becomes more pronounced when price dynamics are more complex, and this has been demonstrated using real data sets from the limit order book of Facebook, Intel, Vodafone and Microsoft.

연구 동기 및 목표

  • 고차원적이고 노이즈가 많은 금융 환경에서 부분 관측 가능성에 의해 제약을 받는 전통적 Q-러닝의 한계를 해결하기 위해.
  • 정책 학습 과정에 불확실성 모델링을 통합하여 알고리즘 거래의 데이터 효율성과 강건성을 향상시키기 위해.
  • 금융 시계열에 대해 딥 생성 모델과 모델 기반 강화학습을 통합하는 통합 프레임워크를 개발하기 위해.
  • 실제 시장 데이터를 사용하여 최적의 실행 작업에서 제안된 RDMM의 성능을 기존 기준선과 비교 평가하기 위해.

제안 방법

  • RDMM는 관측값이 노이즈가 많고 완전하지 않은 상황에서 잠재 상태를 모델링하기 위해 변분 추론을 통합한 딥 마르코프 모델 아키텍처를 사용한다.
  • 관측 노이즈와 모델 불확실성을 모두 고려하여 잠재 상태에 대한 사후 분포를 추정하기 위해 미분 가능한 필터링 메커니즘을 사용한다.
  • 필터링된 상태 추정치의 불확실성을 명시적으로 포함하면서 기대 수익을 최대화하는 기울기 기반 접근 방식을 사용해 정책을 최적화한다.
  • 학습된 동역학 모델을 통한 모델 기반 계획을 통합하여 효율적인 경험 재생과 시뮬레이션 기반 학습을 가능하게 한다.
  • 백프로파게이션 스루 타임과 미분 가능한 강화학습 목표를 사용해 엔드 투 엔드로 모델을 훈련하며, 구성 요소 기여도를 분리하기 위한 아블레이션 연구를 수행한다.
  • 기준선으로 Q-러닝, 다이나Q-ARIMA, 다이나Q-LSTM를 사용하며, RDMM은 다이나Q의 모델 구성 요소를 대체한다.

실험 결과

연구 질문

  • RQ1딥 생성 모델은 부분 관측 가능성 하에서 강화학습 기반 알고리즘 거래의 데이터 효율성과 성능을 향상시킬 수 있는가?
  • RQ2정책 최적화에 상태 불확실성을 통합할 경우 최적의 실행 작업에서 금융 성능에 어떤 영향을 미치는가?
  • RQ3복잡한 가격 역학을 보이는 실제 시장 데이터에서 RDMM은 표준 모델리스 및 모델 기반 기준선을 초월하는가?
  • RQ4VAE, DMM, 불확실성 인식 정책 각 구성 요소의 전체 성능에 기여도는 얼마인가?

주요 결과

  • 모든 테스트 주식에서 Q-러닝, 다이나Q-ARIMA, 다이나Q-LSTM와 비교해 RDMM은 유의미한 금융 수익을 달성했으며, 특히 복잡한 시장 제도에서 성능 향상이 두드러졌다.
  • 정확한 상태 필터링과 불확실성 인식 계획을 통해 데이터 효율성이 뛰어나지며, 상호작용 횟수가 적은 상태에서 효과적인 정책을 학습하는 데 성공했다.
  • 아블레이션 연구를 통해 변분 추론과 불확실성 모델링의 통합이 성능에 결정적인 영향을 미친다는 것이 확인되었으며, 특히 노이즈가 많거나 관측이 불완전한 상황에서 두드러졌다.
  • 페이스북, 인텔, 버즈퍼드, 마이크로소프트의 실제 리미트 오더북 데이터에서 RDMM은 누적 수익과 리스크 조정 수익 측면에서 모든 기준선을 일관되게 뛰어넘었다.
  • 시장 복잡성이 증가할수록 성능 향상이 커지며, 이는 모델이 변동성이 크고 마르코프가 아닌 환경에서도 강건함을 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.