Skip to main content
QUICK REVIEW

[논문 리뷰] Double Deep Q-Learning for Optimal Execution

Brian Ning, Franco Ho Ting Ling|arXiv (Cornell University)|2018. 12. 17.
Stock Market Forecasting Methods참고 문헌 13인용 수 22
한 줄 요약

이 논문은 한정지정주문집합(LOB) 특징, 거래 신호, 행동 공간에서 Q-값을 추정하기 위해 완전히 연결된 신경망을 사용하는 최적의 거래 실행을 위한 더블 딥 Q-러닝(DDQN) 프레임워크를 제안한다. 이 방법은 아홉 종목 중 일곱 종목에서 TWAP 기준선을 초월하며, 중앙값과 평균 초과 수익률이 높고, 손익 비율이 향상되었으며, 여러 자산에 대해 95% 이상의 확률로 TWAP를 능가한다.

ABSTRACT

Optimal trade execution is an important problem faced by essentially all traders. Much research into optimal execution uses stringent model assumptions and applies continuous time stochastic control to solve them. Here, we instead take a model free approach and develop a variation of Deep Q-Learning to estimate the optimal actions of a trader. The model is a fully connected Neural Network trained using Experience Replay and Double DQN with input features given by the current state of the limit order book, other trading signals, and available execution actions, while the output is the Q-value function estimating the future rewards under an arbitrary action. We apply our model to nine different stocks and find that it outperforms the standard benchmark approach on most stocks using the measures of (i) mean and median out-performance, (ii) probability of out-performance, and (iii) gain-loss ratios.

연구 동기 및 목표

  • 제약적인 파rametric 가정에 의존하지 않는 모델-프리 강화학습 접근법을 개발하는 것.
  • 연속적인 상태 및 행동 공간을 갖는 한정지정주문집합의 특성을 다루기 위해 더블 DQN과 경험 재생을 활용한 딥 Q-러닝을 적응시키는 것.
  • 다양한 주식에 걸쳐 실제 시장 데이터를 사용하여 표준 TWAP 기준선과의 성능을 평가하는 것.
  • 상태 표현에 제곱변동성(QV)을 변동성 대체지표로 포함시키는 것이 성능에 미치는 영향을 평가하는 것.
  • 다양한 시장 제도와 주식 특성에 일반화되는 금융적으로 해석 가능한 정책을 제공하는 것.

제안 방법

  • 완전히 연결된 딥 신경망이 상태-행동 쌍에서 기대 누적 보상을 맵핑하는 Q-값 함수를 추정하도록 훈련된다.
  • 상태 표현에는 시간, 재고, 중간가격, 매도매수 스프레드, 제곱변동성(QV)이 특징으로 포함된다.
  • 더블 DQN을 사용하여 Q-값 추정의 과대평가 편향을 줄이고 학습 안정성을 향상시킨다.
  • 경험 재생을 활용하여 시간적 상관관계를 깨고 훈련 중 데이터 효율성을 높인다.
  • 행동 공간은 이산적인 실행 크기로 구성되며, 에이전트는 각 단계에서 추정된 Q-값을 최대화하는 행동을 선택한다.
  • 네트워크는 (상태, 행동, 보상, 다음 상태) 전이를 저장하는 재생 버퍼를 사용하여 훈련되며, 안정성을 위해 타겟 네트워크 업데이트가 수행된다.

실험 결과

연구 질문

  • RQ1딥 강화학습 접근법이 파라미터 모델에 의존하지 않고도 표준 TWAP 기준선을 초월할 수 있는가?
  • RQ2제곱변동성(QV)을 변동성 특징으로 포함시키는 것이 학습된 거래 정책과 성능에 어떤 영향을 미치는가?
  • RQ3DDQN 모델이 유동성과 변동성이 다른 다양한 주식에 대해 얼마나 일반화되는가?
  • RQ4학습된 정책이 재고가 증가하거나 수익 기간이 줄어들수록 실행 속도를 높이는 것과 같은 알려진 경제적 직관을 얼마나 잘 반영하는가?
  • RQ5상태 표현(예: 시간, 가격, 재고, QV)이 전략의 강건성과 초과 수익에 어떤 영향을 미치는가?

주요 결과

  • DDQN 기반 전략은 테스트한 아홉 종목 중 일곱 종목에서 TWAP를 초월하며, 중앙값과 평균 상대 P&L에서 통계적으로 유의미한 초과 수익을 기록했다.
  • INTC의 경우 중앙값 초과 수익은 각각 11.63 basis points (TIP) 및 11.96 basis points (TIPQV)이며, TWAP를 능가할 확률은 각각 95.8% 및 97.8%였다.
  • VOD의 경우 중앙값 초과 수익은 각각 14.68 basis points (TIP) 및 15.72 basis points (TIPQV)였으며, TWAP를 능가할 확률은 각각 97.8% 및 99.2%였다.
  • QV를 특징으로 포함시키는 것은 일반적으로 성능을 향상시키며, 특히 고변동성 제도에서 중앙값 초과 수익과 손익 비율이 높아지는 것으로 나타났다.
  • 전략은 경제적으로 직관적인 행동을 보였다: 시간이 지남에 따라, 가격이 상승하거나 변동성(QV)이 증가할수록 실행이 증가하고, 남은 재고가 줄어들수록 감소했다.
  • 아마존과 구글만이 TWAP에 비해 유의미한 개선을 보이지 않았으며, 성능 지표는 근사하거나 0 이하였고, 이는 저liquidity 또는 고노이즈 환경에서의 이점이 제한적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.