[논문 리뷰] Optimizing Trading Strategies in Quantitative Markets using Multi-Agent Reinforcement Learning
이 논문은 다중 에이전트 강화학습 프레임워크인 CPPI-MADDPG와 TIPP-MADDPG를 제안하며, 다중 에이전트 딥 디터미니스틱 정책 그래디언트(MADDPG) 알고리즘에 일정 비율 포트폴리오 보험(CPPI) 및 시간 불변 포트폴리오 보호(TIPP) 전략을 통합한다. 심천 증권거래소의 100개 실제 주식을 대상으로 평가한 결과, 두 방법 모두 전통적 전략과 기준 강화학습 모델을 능가했으며, TIPP-MADDPG는 연간 수익률 9.68%를 기록해 최고를 기록했고, CPPI-MADDPG는 최고의 샤프 지수 2.18을 기록했다.
Quantitative markets are characterized by swift dynamics and abundant uncertainties, making the pursuit of profit-driven stock trading actions inherently challenging. Within this context, reinforcement learning (RL), which operates on a reward-centric mechanism for optimal control, has surfaced as a potentially effective solution to the intricate financial decision-making conundrums presented. This paper delves into the fusion of two established financial trading strategies, namely the constant proportion portfolio insurance (CPPI) and the time-invariant portfolio protection (TIPP), with the multi-agent deep deterministic policy gradient (MADDPG) framework. As a result, we introduce two novel multi-agent RL (MARL) methods, CPPI-MADDPG and TIPP-MADDPG, tailored for probing strategic trading within quantitative markets. To validate these innovations, we implemented them on a diverse selection of 100 real-market shares. Our empirical findings reveal that the CPPI-MADDPG and TIPP-MADDPG strategies consistently outpace their traditional counterparts, affirming their efficacy in the realm of quantitative trading.
연구 동기 및 목표
- 인간 트레이더가 비합리적 결정을 내기 쉬운 고빈도, 불확실성 및 동적인 정량적 트레이딩 환경에서의 과제를 해결하기 위해.
- 기존 금융 리스크 제어 전략인 CPPI 및 TIPP를 다중 에이전트 강화학습 프레임워크에 통합하여 변동성이 큰 시장에서 포트폴리오 관리 성능을 향상시키기 위해.
- 규칙 기반 포트폴리오 보호 메커니즘과 MARL을 융합했을 때, 표준 강화학습 및 전통적 포트폴리오 방법에 비해 뛰어난 리스크 조정 수익률을 달성할 수 있는지 평가하기 위해.
- 심천 증권거래소의 100개 주식에 대한 실시장 조건에서의 실증적 백테스팅을 통해 CPPI-MADDPG 및 TIPP-MADDPG의 유효성을 입증하기 위해.
제안 방법
- 프레임워크는 N개의 에이전트로 구성된 스토케스틱 게임으로 전략적 트레이딩을 모델링하며, 각 에이전트는 주식 가격, 소유 주식, 현금 잔고를 나타내는 공통 상태 벡터 s = [p, h, b]를 관찰한다.
- 각 에이전트는 정책 네트워크 πθi를 사용하여 관찰 결과에 기반해 행동(포트폴리오 가중치)을 선택하며, 행동은 CPPI 또는 TIPP 규칙 기반 보험 논리에 따라 제약을 받는다.
- MADDPG 알고리즘은 공동 행동과 상태를 관찰하는 중심화된 크리틱을 포함하도록 수정되어, 책임 할당 및 개선된 공동 정책 학습을 가능하게 한다.
- 재생 버퍼는 전이 ⟨s, a, r, s′⟩를 저장하며, 학습 안정성을 높이기 위해 τ = 0.01로 소프트 업데이트 규칙을 사용해 타겟 네트워크를 갱신한다.
- 행동 선택 과정에는 노이즈 프로세스 𝒩를 통한 탐색이 포함되며, 행동이 규칙 기반 정책 Φ(s) 외부로 벗어나면 CPPI/TIPP 제약 조건을 만족하도록 클리핑 또는 조정한다.
- 크리틱은 식 (4)의 손실을 최소화하도록 훈련되며, 액터는 식 (3)의 정책 그래디언트를 사용해 업데이트되며, 양측 모두 더블-Q 타겟 추정 방식을 사용한다.
실험 결과
연구 질문
- RQ1CPPI 및 TIPP 리스크 제어 메커니즘을 다중 에이전트 딥 강화학습과 융합함으로써 정량적 트레이딩 환경에서 포트폴리오 성능을 향상시킬 수 있는가?
- RQ2CPPI-MADDPG 및 TIPP-MADDPG는 기준 강화학습 방법(MADDPG, MADQN 등) 및 전통적 전략(예: 유니버설 포트폴리오)에 비해 리스크 조정 수익률 측면에서 어떻게 비교되는가?
- RQ3규칙 기반 포트폴리오 보험의 통합이 제약 없는 강화학습 에이전트에 비해 안정성을 향상시키고 최대 손실을 줄이는가?
- RQ4CPPI(간극 리스크)와 TIPP(시간 기반 바닥선)의 고유한 리스크 프로파일이 하이브리드 MARL 모델의 성능에 어떻게 영향을 미치는가?
- RQ5하이브리드 모델이 매개변수 조정을 통해 다양한 투자자 리스크 선호도에 얼마나 잘 적응할 수 있는가?
주요 결과
- TIPP-MADDPG는 9.68%의 최고 연간 수익률을 기록하여, 유니버설 포트폴리오(3.36%) 및 MADDPG(8.22%)를 크게 앞섰다.
- CPPI-MADDPG는 2.18의 최고 샤프 지수를 기록하여, TIPP-MADDPG(2.09) 및 MADDPG(1.99)에 비해 뛰어난 리스크 조정 수익률을 보였다.
- CPPI-MADDPG는 6.60%의 최저 최대 손실을 기록하여, TIPP-MADDPG(9.02%) 및 MADDPG(12.26%)에 비해 더 강력한 하방 보호 성능을 보였다.
- TIPP-MADDPG 전략은 80번째에서 160번째 거래일 사이에 급격한 수익률 상승을 보이며 시장 추세에 민감하게 반응하는 것으로 나타났다.
- MADDPG 기반 에이전트는 더 균일한 자산 배분을 보였고, CPPI-MADDPG 및 TIPP-MADDPG 에이전트는 규칙 기반 배분을 반영해 더 흐릿한(스parser) 할당을 선택했다. 이는 전략적 리스크 제어를 반영한다.
- 특정 매개변수 설정 하에서 하이브리드 모델은 기준 MADDPG 성능으로 복귀하는 것을 확인하여, 리스크 선호도 조정을 위한 유연성과 제어 가능성의 성공을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.