Skip to main content
QUICK REVIEW

[논문 리뷰] TradeR: Practical Deep Hierarchical Reinforcement Learning for Trade Execution

Karush Suri, Xiao Qi Shi|arXiv (Cornell University)|2021. 02. 16.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

TradeR는 2019년 코로나19 주식시장 폭락과 같은 급격한 시장 변화 상황에서 재앙과 놀라움 최소화 문제를 해결하기 위해 계층적 딥 강화학습 프레임워크를 제안한다. 에너지 기반 내재 동기 부여 기반과 놀라움 가치 함수를 통합함으로써, TradeR은 35개의 S&P500 주식에서 위험 감소와 안정된 성능을 기반으로 강력하고 수익성 있는 거래를 달성한다.

ABSTRACT

Advances in Reinforcement Learning (RL) span a wide variety of applications which motivate development in this area. While application tasks serve as suitable benchmarks for real world problems, RL is seldomly used in practical scenarios consisting of abrupt dynamics. This allows one to rethink the problem setup in light of practical challenges. We present Trade Execution using Reinforcement Learning (TradeR) which aims to address two such practical challenges of catastrophy and surprise minimization by formulating trading as a real-world hierarchical RL problem. Through this lens, TradeR makes use of hierarchical RL to execute trade bids on high frequency real market experiences comprising of abrupt price variations during the 2019 fiscal year COVID19 stock market crash. The framework utilizes an energy-based scheme in conjunction with surprise value function for estimating and minimizing surprise. In a large-scale study of 35 stock symbols from the S&P500 index, TradeR demonstrates robustness to abrupt price changes and catastrophic losses while maintaining profitable outcomes. We hope that our work serves as a motivating example for application of RL to practical problems.

연구 동기 및 목표

  • 실제 거래 환경에서의 실용적 과제, 특히 재앙과 놀라움 최소화 문제를 강화학습 분야에서 해결하기 위해.
  • 급격한 시장 역학 상황에서도 안정적이고 수익성 있는 거래 실행을 가능하게 하는 계층적 강화학습 프레임워크를 개발하기 위해.
  • 에너지 기반 기반의 내재 동기 부여와 놀라움 가치 함수를 통합하여 리스크 회피적 의사결정을 유도하기 위해.
  • 2019년 코로나19 시장 폭락 기간 동안 실제 고빈도 시장 데이터를 기반으로 프레임워크를 평가하기 위해.
  • 보유 행동과 내재 동기 부여가 인간 유사 거래 행동을 모방하는 데 어떻게 기여하는지 입증하기 위해.

제안 방법

  • TradeR는 두 수준의 계층적 정책을 사용한다: 저수준의 주문 정책은 최적의 거래 수량을 추정하고, 고수준의 입찰 정책은 현재 시장 상태에 기반해 거래를 실행한다.
  • 에너지 기반 내재 동기 부여 기반은 실시간으로 놀라움을 추정하여 에이전트가 예측 불가능한 시장 충격을 최소화할 수 있도록 한다.
  • 놀라움 가치 함수는 내재 보상 신호로 작용하여 에이전트가 높은 놀라움 상태를 피하고 재앙적 손실을 줄이도록 이끈다.
  • 프레임워크는 2019년 시장 폭락 기간 동안 35개의 S&P500 주식에서 1분 단위 고빈도 데이터를 사용하여 훈련되며, 함수 근사에 딥 Q넷워크를 사용한다.
  • 에이전트는 '보유' 행동을 제공받아 시장 조건이 불리할 경우 거래를 중단할 수 있어 리스크 제어를 향상시킨다.
  • 제거 실험은 내재 동기 부여와 보유 행동이 성능, 리스크, 랜덤 시드 간 일관성에 미치는 영향을 평가한다.

실험 결과

연구 질문

  • RQ1계층적 강화학습 프레임워크는 급격한 시장 사건 기간 동안 놀라움과 재앙적 손실을 효과적으로 최소화할 수 있는가?
  • RQ2에너지 기반 내재 동기 부여 기반을 통합함으로써 고빈도 거래에서의 안정성과 수익성이 어떻게 향상되는가?
  • RQ3'보유' 행동의 포함이 강화학습 기반 거래 에이전트의 안정성과 리스크 회피 행동에 어느 정도 기여하는가?
  • RQ4TradeR 프레임워크는 다양한 초기 자본 수준과 시장 변동성 조건에서 어떻게 성능을 발휘하는가?
  • RQ5내재 동기 부여 기반은 인간 유사 거래 패턴, 예를 들어 더 많이 사고 덜 팔도록 유도하는가?

주요 결과

  • TradeR는 2019년 시장 폭락 기간 동안 35개의 S&P500 주식에서 급격한 가격 변동 조건에도 불구하고 일관된 수익성과 강건성을 보였다.
  • 보유 행동의 포함은 성능 안정성에 상당한 기여를 하였으며, 불리한 조건에서 불필요한 거래를 피할 수 있도록 하였다.
  • 에너지 기반 내재 동기 부여 기반은 총 판매 주식 수를 감소시키고 랜덤 시드 간 분산을 낮춰 더 리스크 회피적인 행동을 나타내었다.
  • 높은 초기 자본 수준일수록 성능이 향상되어 프레임워크의 확장성과 증가하는 거래 부담에 대한 적응 가능성을 시사하였다.
  • 제거 실험 결과, 놀라움 가치 함수와 보유 행동이 재앙적 손실 최소화와 안정된 수익 유지에 핵심적인 역할을 한다는 것이 확인되었다.
  • 랜덤 시드 간 안정적인 학습을 달성하여 고위험·고빈도 환경에서 샘플 효율성과 신뢰성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.