[논문 리뷰] Reinforcement Learning in High-frequency Market Making
이 논문은 고주기 시장 메이킹에서 강화학습(RL)에 대한 최초의 종합적인 이론적 분석을 제공하며, 표본 추출 주기가 증가함에 따라 이산시간 RL 알고리즘의 연속시간 모델로의 수렴성을 확립한다. 이는 시간 간격 Δ에 대한 학습 오차와 계산 복잡도 사이의 상충 관계를 드러내며, 두 명의 플레이어가 참여하는 일반합 게임 설정에서 나시 균형의 수렴성을 증명한다.
This paper establishes a new and comprehensive theoretical analysis for the application of reinforcement learning (RL) in high-frequency market making. We bridge the modern RL theory and the continuous-time statistical models in high-frequency financial economics. Different with most existing literature on methodological research about developing various RL methods for market making problem, our work is a pilot to provide the theoretical analysis. We target the effects of sampling frequency, and find an interesting tradeoff between error and complexity of RL algorithm when tweaking the values of the time increment $Δ$ $-$ as $Δ$ becomes smaller, the error will be smaller but the complexity will be larger. We also study the two-player case under the general-sum game framework and establish the convergence of Nash equilibrium to the continuous-time game equilibrium as $Δ ightarrow0$. The Nash Q-learning algorithm, which is an online multi-agent RL method, is applied to solve the equilibrium. Our theories are not only useful for practitioners to choose the sampling frequency, but also very general and applicable to other high-frequency financial decision making problems, e.g., optimal executions, as long as the time-discretization of a continuous-time markov decision process is adopted. Monte Carlo simulation evidence support all of our theories.
연구 동기 및 목표
- 강화학습(RL)을 고주기 시장 메이킹에 적용하기 위한 엄밀한 이론적 기초를 제공하여, 히우리스틱 방법론 연구를 넘어서는 것.
- 연속시간 금융 모델에서 RL 알고리즘의 정확도와 계산 복잡도에 미치는 표본 추출 주파수(시간 간격 Δ)의 영향을 분석하는 것.
- 다수의 시장 메이커가 참여하는 경쟁적 시장 메이킹 시나리오에 대해 게임 이론적 프레임워크를 활용하여 분석을 확장하는 것.
- Δ → 0일 때 이산시간 RL 해법(e.g., 나시 Q-학습)이 연속시간 해법으로 수렴하는 이론적 수렴성을 확립하는 것.
- 오차와 계산 비용 사이의 상충 관계를 바탕으로 실무자들이 최적의 표본 추출 주파수를 선택하는 데 도움이 되는 실용적 지침을 제공하는 것.
제안 방법
- 이산시간 RL 알고리즘 적용을 가능하게 하기 위해 시간 간격 Δ를 사용하여 연속시간 마르코프 결정 과정(MDP)을 시간 이산화하는 것.
- 이산화된 MDP에서 최적의 시장 메이킹 정책을 해결하기 위해 단일 에이전트 RL에 Q-학습을 적용하고, 학습 오차에 대한 이론적 경계를 도출하는 것.
- 시장 메이커 간의 경쟁을 포괄하기 위해 두 명의 플레이어가 참여하는 일반합 확률적 게임 모델으로 확장하고, 나시 균형을 해법 개념으로 사용하는 것.
- 이산화된 게임 설정에서 다중 에이전트 RL에 대한 나시 Q-학습 알고리즘을 개발하고 이론적으로 분석하는 것.
- 이론적 수렴 결과를 검증하고 RL 알고리즘의 실증 성능을 시연하기 위해 몬테카를로 시뮬레이션을 사용하는 것.
- 제어된 마르코프 체인 이론과 확률적 근사 이론을 활용하여, Δ → 0일 때 가치 함수와 정책의 수렴 속도를 이론적으로 유도하는 것.
실험 결과
연구 질문
- RQ1표본 추출 주파수 Δ의 선택이 RL 기반 고주기 시장 메이킹에서의 학습 오차와 계산 복잡도에 어떻게 영향을 미치는가?
- RQ2Δ → 0일 때 이산화된 RL 해법과 진정한 연속시간 최적 정책 사이의 이론적 관계는 무엇인가?
- RQ3이산화된 두 플레이어 게임의 나시 균형이 Δ → 0일 때 연속시간 게임 균형으로 수렴하는가?
- RQ4나시 Q-학습 알고리즘이 다중 에이전트 고주기 시장 메이킹 환경에서 균형 전략을 효과적으로 학습할 수 있는가?
- RQ5단일 에이전트 및 다중 에이전트 설정 모두에서 표본 복잡도 및 오차의 이론적 경계는 Δ에 따라 어떻게 척도화되는가?
주요 결과
- 학습 오차와 알고리즘 복잡도 사이에 상충 관계가 존재한다: Δ가 감소할수록(표본 추출 주파수가 높아질수록) 학습 오차는 감소하지만 계산 비용은 증가한다.
- 단일 에이전트 케이스에서 가치 함수 오차는 Δ → 0일 때 0으로 수렴하며, 시뮬레이션 결과에서 실측 오차가 (0.09, 0.05)로 감소한다.
- 나시 Q-학습 알고리즘의 정책 오차는 시뮬레이션에서 0에 도달하여 진정한 균형 정책을 정확히 복원함을 나타낸다.
- 이산화된 모델에서의 나시 균형 전략과 가치 함수가 연속시간 모델로의 수렴이 실증적으로 검증되었으며, |VΔ − V0| < 0.057를 만족한다.
- 이론적 분석을 통해 이산시간 게임의 나시 균형이 Δ → 0일 때 연속시간 게임 균형으로 수렴한다는 것이 확인된다.
- 제안된 프레임워크는 최적의 실행 등 연속시간 MDP를 시간 이산화한 문제를 포함한 다른 고주기 금융 문제에 일반화 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.