[논문 리뷰] Model-based Reinforcement Learning for Predictions and Control for Limit Order Books
이 논문은 역사적 오더북 데이터만을 사용하여 실제 시장 상호작용 없이도 거래 에이전트를 훈련하는 모델 기반 강화학습 프레임워크를 제안한다. 학습된 환경 모델을 통해 시장 역학을 시뮬레이션하고, 실시간 상호작용 없이도 거래 정책을 최적화한다. 이 방법은 실제 시장에서 수익성 있고 이식 가능한 정책을 달성하며, 다양한 시장 제도에서 샘플 효율성과 안정성이 기준 전략보다 향상된 강력한 성능을 보인다.
We build a profitable electronic trading agent with Reinforcement Learning that places buy and sell orders in the stock market. An environment model is built only with historical observational data, and the RL agent learns the trading policy by interacting with the environment model instead of with the real-market to minimize the risk and potential monetary loss. Trained in unsupervised and self-supervised fashion, our environment model learned a temporal and causal representation of the market in latent space through deep neural networks. We demonstrate that the trading policy trained entirely within the environment model can be transferred back into the real market and maintain its profitability. We believe that this environment model can serve as a robust simulator that predicts market movement as well as trade impact for further studies.
연구 동기 및 목표
- 금융 시장과의 실시간 상호작용이 필요 없이도 수익성 있는 거래 정책을 학습하는 모델 기반 강화학습 프레임워크를 개발하는 것.
- 잠재 공간에서 자기지도적 표현 학습을 통해 오더북의 시간적 및 인과적 역학을 포착하는 데이터 기반 환경 모델을 구축하는 것.
- 시뮬레이션 환경에서 훈련된 정책을 실제 시장으로 이식하여 일관된 수익성을 달성하는 것.
- 모델 자유형 강화학습의 한계, 즉 높은 샘플 복잡성과 시도 오류 훈련으로 인한 위험을 해결하는 것.
- 전자 거래에서 시장 움직임과 거래 영향을 예측하기 위한 강력하고 일반적인 시뮬레이터를 제공하는 것.
제안 방법
- 프레임워크는 깊은 신경망을 사용하여 역사적 데이터로부터 오더북의 잠재 공간 표현을 학습하여 시간적 및 인과적 의존성을 포착한다.
- 대조 학습을 사용하여 현재 관측치와 행동에서 미래 상태와 보상을 예측하는 방식으로 자기지도적 방식으로 세계 모델을 훈련한다.
- 강화학습 에이전트는 학습된 환경 모델 내에서만 훈련되며, 정책 기반(PP), A2C, 또는 DQN 알고리즘을 사용하여 거래 전략을 최적화한다.
- 모델은 상태 전이와 보상 신호의 종합적 표현을 끝에서 끝까지 학습하여 시장 진화와 거래 영향을 동시에 예측할 수 있도록 한다.
- 정책은 실제 시장 데이터로의 이식을 통해 평가되며, 다양한 시장 제도에서 누적 PnL를 비교한다.
- 시스템은 샘플 효율성과 안정성을 고려하여 훈련 중 실제 시장 위험에 노출되는 것을 최소화하도록 설계되어 있다.
실험 결과
연구 질문
- RQ1모델 기반 강화학습 에이전트는 실시간 환경 상호작용 없이도 역사적 오더북 데이터만을 사용하여 수익성 있는 거래 정책을 학습할 수 있는가?
- RQ2자기지도적 세계 모델이 효과적인 정책 훈련을 위해 오더북의 시간적 및 인과적 역학을 얼마나 잘 포착할 수 있는가?
- RQ3시뮬레이션 환경에서 훈련된 정책이 실제 시장 조건으로 이식될 때 수익성을 유지하는 데까지 어느 정도까지 가능한가?
- RQ4모델 기반 강화학습 에이전트의 성능은 다양한 시장 제도에서 전통적인 기준 전략(예: 모멘타임 기반, 분류기 기반)과 비교해 볼 때 어떻게 되는가?
- RQ5저데이터 제도, 예를 들어 추세 신호가 제한된 진동하는 시장에서 이 방법의 한계는 무엇인가?
주요 결과
- 환경 모델 내에서만 훈련된 RL 에이전트는 게리옵티멀 솔루션의 10%~30% 이내의 누적 PnL 성능를 달성했으며, 평균적으로 모멘타임 기반 및 분류기 기반 기준 전략을 모두 초월했다.
- A2C 알고리즘이 PG와 DQN보다 더 안정적인 성능를 보였고, DQN은 상태 표현이 최적화되지 않아 성능이 열 劣하였다.
- 분류기 기반 에이전트는 클래스 불균형으로 인해 자주 가격 움직임을 '변화 없음'으로 잘못 분류하고 행동을 취하는 빈도가 낮아 성능이 열 劣하였다.
- RL 에이전트는 상승장과 하락장에서 강력한 성능를 보였지만, 훈련 데이터가 부족한 진동하는 시장에서는 어려움을 겪었다(전체 데이터의 약 15.8%).
- 세계 모델에서 훈련된 정책은 실제 시장 조건으로 성공적으로 이식되었으며, 무작위로 선택된 다섯 날 동안 점점 수렴하는 성능 일致성을 보였다.
- 환경 모델는 시장 움직임과 거래 영향을 효과적으로 예측하여, 향후 연구를 위한 강력한 시뮬레이터로의 사용을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.