Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning for Market Making in a Multi-agent Dealer Market

Sumitra Ganesh, Nelson Vadori|arXiv (Cornell University)|2019. 11. 14.
Auction Theory and Applications참고 문헌 16인용 수 19
한 줄 요약

이 논문은 딜러 마켓 환경에서 시장 제작자를 시뮬레이션하고 훈련하기 위한 다중 에이전트 강화학습(RL) 프레임워크를 제안한다. 고유의 시뮬레이터를 사용하여, RL 에이전트는 수요-공급 스프레드를 적응적으로 설정하고 재고 기반으로 가격을 왜곡하며, 시장 가격의 이탈에 따라 포지션 크기를 동적으로 조정함으로써 경쟁적이고 위험 감수성 있는 상황에서 안정적인 성능을 달성한다.

ABSTRACT

Market makers play an important role in providing liquidity to markets by continuously quoting prices at which they are willing to buy and sell, and managing inventory risk. In this paper, we build a multi-agent simulation of a dealer market and demonstrate that it can be used to understand the behavior of a reinforcement learning (RL) based market maker agent. We use the simulator to train an RL-based market maker agent with different competitive scenarios, reward formulations and market price trends (drifts). We show that the reinforcement learning agent is able to learn about its competitor's pricing policy; it also learns to manage inventory by smartly selecting asymmetric prices on the buy and sell sides (skewing), and maintaining a positive (or negative) inventory depending on whether the market price drift is positive (or negative). Finally, we propose and test reward formulations for creating risk averse RL-based market maker agents.

연구 동기 및 목표

  • 딜러(장외) 시장에서 강화학습 기반 시장 제작을 연구하기 위한 현실적인 다중 에이전트 시뮬레이션 환경을 개발하기 위해.
  • 부분 관측 조건 하에서 RL 에이전트가 경쟁적 가격 전략과 재고 관리를 어떻게 학습하는지 조사하기 위해.
  • RL 기반 시장 제작자에서 위험 회피성과 재고 제어에 영향을 미치는 다양한 보상 설계의 영향을 평가하기 위해.
  • 시장 가격 이탈이 RL 에이전트의 최적의 재고 위치와 왜곡 행동에 어떤 영향을 미치는지 이해하기 위해.
  • 더 안정적이고 위험 회피적인 시장 제작 정책을 생성하는 데 효과적인 위험 페널티 함수를 설계하고 테스트하기 위해.

제안 방법

  • 직접 거래 데이터만 관측 가능한, 상호작용하는 시장 제작자와 투자자 에이전트로 구성된 다중 에이전트 시스템으로 딜러 마켓을 수학적으로 정의한다.
  • RL 에이전트의 현실적인 경쟁자로, 평균-분산 최적화 기반의 적응형 시장 제작자 에이전트를 구현한다.
  • 재고, 중간 가격, 주문 유입량을 포함한 상태 표현을 사용하여 딥 Q네트워크(DQN)를 활용해 RL 에이전트를 훈련시킨다.
  • 위험 회피 행동을 장려하기 위해 재고 위험 페널티(예: 이차형 및 지수형 페널티)를 포함한 보상 함수를 설계한다.
  • 지속적, 무작위, 적응형 경쟁자 등 다양한 경쟁 시나리오를 시뮬레이션한다. 각 경쟁자는 서로 다른 가격 정책을 가진다.
  • 장기적 행동과 수렴성을 연구하기 위해 1개 롤아웃당 200개 타임스텝으로 시간 이산화된 환경을 사용한다.

실험 결과

연구 질문

  • RQ1RL 기반 시장 제작자는 거래의 부분 관측만으로 다른 경쟁 시장 제작자의 가격 정책을 학습할 수 있는가?
  • RQ2재고 수준과 시장 이탈에 따라 RL 에이전트는 어떻게 입찰-매도 스프레드와 가격 왜곡을 조정하는가?
  • RQ3위험 페널티를 통한 보상 형태 조정이 재고 변동성 감소와 포지션 크기 안정화에 어느 정도 기여하는가?
  • RQ4시장 가격 이탈은 RL 에이전트의 최적 재고 위치에 어떤 영향을 미치는가?
  • RQ5양의 또는 음의 이탈을 이용해 방향성 있는 재고 포지션을 유지함으로써 RL 에이전트는 이를 활용할 수 있는가?

주요 결과

  • RL 에이전트는 자신만의 거래와 실행 결과에 대한 부분 관측만으로도 경쟁적 적응형 시장 제작자의 가격 전략을 성공적으로 유추한다.
  • 명시적인 편향이나 사전 지시 없이도, 재고가 음수일 경우 입찰 스프레드를 낮추고 재고가 양수일 경우 매도 스프레드를 낮추는 등 자율적으로 가격 왜곡 행동을 개발한다.
  • 양의 이탈(μ = 1) 상황에서는 평균 16.06의 큰 양의 재고를 축적하는 반면, 음의 이탈(μ = -1) 상황에서는 평균 -16.06의 음의 재고를 유지함으로써, 시장 추세에 동적으로 적응하는 것을 확인할 수 있다.
  • 보상 신호에 위험 페널티 함수를 포함시킴으로써 재고 및 재고 PnL의 표준편차가 감소하고 절대 평균 재고가 감소함을 확인하여, 위험 회피 설계의 효과성을 입증한다.
  • 다양한 훈련 런에 걸쳐 정책 학습 수렴이 이루어지며, 지속적 및 적응형 경쟁자 모두에 대해 안정적인 성능을 보였다.
  • 에이전트의 성능은 다양한 시장 조건에서도 뛰어난 일반화 능력을 보이며, 이는 이격도 수준과 경쟁자 행동의 다양성에 대해 우수한 적응성을 가짐을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.