Skip to main content
QUICK REVIEW

[논문 리뷰] Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response

Svitlana Vyetrenko, Shaojie Xu|arXiv (Cornell University)|2019. 06. 05.
Stock Market Forecasting Methods참고 문헌 35인용 수 4
한 줄 요약

이 논문은 한정된 주문도서 시장에서 고량 주문 청산을 최적화하기 위해 압축된 의사결정 트리 기반의 위험 감수성 강화학습 프레임워크를 제안한다. 역사적 데이터로부터 시장 영향력과 다른 참가자의 반응을 모델링하는 시뮬레이터에서 에이전트를 훈련시킴으로써, 이 방법은 실행 비용을 32% 감소시키면서도 비용 분산을 27% 증가시켜, 기준 전략 대비 개선된 위험 조정 성과를 입증한다.

ABSTRACT

We demonstrate an application of risk-sensitive reinforcement learning to optimizing execution in limit order book markets. We represent taking order execution decisions based on limit order book knowledge by a Markov Decision Process; and train a trading agent in a market simulator, which emulates multi-agent interaction by synthesizing market response to our agent's execution decisions from historical data. Due to market impact, executing high volume orders can incur significant cost. We learn trading signals from market microstructure in presence of simulated market response and derive explainable decision-tree-based execution policies using risk-sensitive Q-learning to minimize execution cost subject to constraints on cost variance.

연구 동기 및 목표

  • 한정 주문도서 시장에서 위험 조정 비용을 최소화하는 자율 거래 에이전트를 개발하는 것.
  • 역사적 오더 플로우를 기반으로 한 데이터 기반 시뮬레이터를 활용해 다른 참가자의 시장 영향력과 반응을 모델링하는 것.
  • 위험 감수성 Q-학습을 통해 해석 가능하고 압축된 의사결정 트리 정책을 생성하여 실세계에 구현 가능한 것.
  • 위험 감수성 강화학습을 통해 비용 절감과 비용 분산 간의 균형을 이루는 것.
  • 의사결정 트리 기반 에이전트의 성능을 기존 비-RL 기준 전략(예: TWAP, VWAP)과 비교하는 것.

제안 방법

  • 상태 변수로 한정 주문도서 특성과 에이전트의 포지션을 활용하여 문제를 마르코프 결정 과정(MDP)으로 모델링한다.
  • 역사적 데이터에서 학습하여 다중 에이전트 시장 반응을 시뮬레이션하는 시장 시뮬레이터를 구축하며, 공격적인 거래에 대해 다른 참가자가 어떻게 반응하는지를 모방한다.
  • 기대 실행 비용과 그 분산을 모두 페널티로 포함하는 비용 함수를 사용한 위험 감수성 Q-학습을 적용하며, 이는 위험 감수성 파라미터 β로 제어된다.
  • 결과적으로 도출된 Q-값 테이블은 헌트 알고리즘을 사용하여 의사결정 트리로 변환되어 해석 가능성과 압축된 표현을 확보한다.
  • 상태 변수는 표본 분포를 균형 있게 유지하기 위해 버킷으로 이산화되며, 버킷 경계는 이에 따라 선택된다.
  • 프레임워크는 시뮬레이션 환경에서 훈련 및 검증되며, 비-RL 기준 전략(예: TWAP)과의 성능 비교가 이루어진다.

실험 결과

연구 질문

  • RQ1위험 감수성 강화학습은 한정 주문도서 거래에서 실행 비용과 위험 조정 성과를 향상시킬 수 있는가?
  • RQ2Q-학습에서 유도된 의사결정 트리 기반 정책은 전통적인 실행 전략(TWAP, VWAP)과 비교해 어떻게 다른가?
  • RQ3시뮬레이션된 시장 반응이 실제 다중 에이전트 상호작용을 얼마나 정확하게 반영할 수 있는가?
  • RQ4압축되고 해석 가능한 의사결정 트리는 강화학습을 통해 학습된 복잡한 실행 정책을 효과적으로 표현할 수 있는가?
  • RQ5위험 감수성 학습 하에서 비용 절감과 비용 분산 간의 트레이드오프는 어떻게 나타나는가?

주요 결과

  • RL 기반 의사결정 트리 에이전트는 비-RL 기준 전략 대비 실행 비용을 32% 감소시켰다.
  • 이 비용 절감은 비용 표준편차가 27% 증가함으로써 위험을 의도적으로 수용한 트레이드오프를 반영한다.
  • 시뮬레이터는 역사적 데이터를 기반으로 공격적인 거래에 대한 시장 반응을 성공적으로 시뮬레이션하여 현실적인 다중 에이전트 상호작용 모델링을 가능하게 하였다.
  • 의사결정 트리 정책는 압축되고 해석 가능하여 알고리즘 거래 시스템에 실용적으로 구현 가능한 것으로 나타났다.
  • 위험 감수성 Q-학습 접근법은 β 파라미터를 통해 비용 최소화와 분산 제어를 효과적으로 균형 잡는 데 기여하였다.
  • 결과적으로 모델리스 강화학습과 해석 가능한 정책 표현 방식이 동적인 영향력 고려 환경에서 정적 실행 전략을 능가할 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.