Skip to main content
QUICK REVIEW

[논문 리뷰] Extending Deep Reinforcement Learning Frameworks in Cryptocurrency Market Making

Jonathan Sadighian|arXiv (Cornell University)|2020. 04. 15.
Stock Market Forecasting Methods참고 문헌 11인용 수 4
한 줄 요약

이 논문은 기존의 시간 또는 틱 기반 이벤트 대신 가격 변화를 트리거로 삼는 가격 기반 이벤트 기반 강화학습 프레임워크를 제안한다. Bitmex LOB 데이터를 바탕으로 A2C 및 PPO 알고리즘을 사용한 결과, 특히 TC 보상 함수에서 수익성과 안정성이 향상되었으며, 일곱 가지 보상 함수와 30일의 검증 테스트에서 시간 기반 기준보다 뛰어난 성능을 보였다.

ABSTRACT

There has been a recent surge in interest in the application of artificial intelligence to automated trading. Reinforcement learning has been applied to single- and multi-instrument use cases, such as market making or portfolio management. This paper proposes a new approach to framing cryptocurrency market making as a reinforcement learning challenge by introducing an event-based environment wherein an event is defined as a change in price greater or less than a given threshold, as opposed to by tick or time-based events (e.g., every minute, hour, day, etc.). Two policy-based agents are trained to learn a market making trading strategy using eight days of training data and evaluate their performance using 30 days of testing data. Limit order book data recorded from Bitmex exchange is used to validate this approach, which demonstrates improved profit and stability compared to a time-based approach for both agents when using a simple multi-layer perceptron neural network for function approximation and seven different reward functions.

연구 동기 및 목표

  • 강화학습을 통한 마켓 메이킹 환경에서 지연 민감도가 높은 시간 또는 틱 기반 이벤트 환경의 한계를 해결하기 위해.
  • 에이전트가 중요한 가격 변화가 발생할 때만 행동하는 새로운 가격 기반 이벤트 환경을 제안하고 평가하기 위해.
  • 딥 강화학습 프레임워크 내에서 다양한 보상 함수의 성능을 비교하기 위해.
  • 고빈도 LOB 데이터에서 발생하는 노이즈를 줄이고 더 안정적이고 지능적인 전략을 구현하기 위해 DRLMM 프레임워크를 확장하기 위해.

제안 방법

  • 상태 공간은 레벨 II LOB 데이터에서 유도된 마코프 결정 과정(MDP)을 사용하며, 주문 흐름 불균형 및 유도된 지표를 포함한다.
  • 정책 기반 딥 강화학습 알고리즘인 A2C와 PPO를 사용하여 에이전트를 훈련시키며, 함수 근사에 다층 퍼셉트론을 활용한다.
  • 환경은 가격 기반 이벤트로 정의되며, 가격 변화가 임계값을 초과할 경우에만 행동이 발생하여 비의미적인 틱에서 오는 노이즈를 감소시킨다.
  • 일곱 가지 다른 보상 함수를 평가한다: UPnL, UPnLwF, Asym, AsymC, ΔRPnL, TC, DSR. 각 보상 함수는 에이전트 행동을 서로 다른 리스크-수익 목표로 유도한다.
  • 훈련은 8일 간의 Bitmex LOB 데이터(1M 스텝)를 사용하며, 일반화 능력과 수익성 평가를 위해 30일 간의 검증 데이터를 활용한다.
  • 누적 수익, 손익, 안정성 지표를 바탕으로 여러 실험 세트에서 성능을 측정한다.

실험 결과

연구 질문

  • RQ1암호화폐 마켓 메이킹에서 가격 기반 이벤트 환경은 시간 또는 틱 기반 환경에 비해 에이전트의 수익성과 안정성 측면에서 어떻게 비교되는가?
  • RQ2일곱 가지 보상 함수 중 어느 것이 시간 기반 및 가격 기반 이벤트 설정 모두에서 가장 강력하고 수익성 있는 거래 전략을 도출하는가?
  • RQ3제한된 역사적 데이터로 훈련된 정책 기반 딥 강화학습 에이전트는 다양한 마켓 제도에서 일반화할 수 있는가?
  • RQ4가격 임계값을 통해 이벤트 빈도를 줄이면 고빈도 LOB 환경에서 학습 효율성이 향상되고 비정상적인 거래 행동이 감소하는가?

주요 결과

  • 모든 이벤트 유형에서 A2C 에이전트가 누적 수익과 수익성 있는 실험 수량 측면에서 PPO를 앞섰다.
  • TC(타겟 완료) 보상 함수는 시간 기반 및 가격 기반 환경 모두에서 가장 높은 수익률을 기록했으며, 시간 기반 환경에서 Set 3에서 17.61%의 수익률을 기록했다.
  • 가격 기반 이벤트는 특히 큰 가격 상승 시기 동안 더 안정적인 거래 패턴을 보였으며, 노이즈로 인한 비정상적인 행동을 감소시켰다.
  • 가격 기반 이벤트를 사용한 84개 실험 중 23개가 수익성을 보였고, 이는 시간 기반 환경 대비 더 높은 학습 효율성을 시사한다.
  • AsymC 보상 함수는 일부 실험 세트에서 뛰어난 성능을 보였으며, 한 가격 기반 실험에서 11.88%의 수익률을 기록하여 비대칭 리스크 조정 전략이 효과적일 수 있음을 시사한다.
  • DSR(Differential Sharpe Ratio) 보상 함수는 혼합된 결과를 보였으며 대부분의 경우 손실을 기록하여 고변동성 제도에서의 불안정성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.