Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Market Making in a Multi-agent Dealer Market

Sumitra Ganesh, Nelson Vadori|arXiv (Cornell University)|Nov 14, 2019
Auction Theory and Applications参考文献 16被引用 19
一句话总结

本文提出了一种多智能体强化学习(RL)框架,用于在做市商市场环境中模拟和训练做市商。通过自定义模拟器,RL智能体学习自适应地设定买卖价差,根据库存情况调整价格偏移,并根据市场价格漂移动态调整头寸规模,在竞争性和风险敏感的情境下均表现出稳健性能。

ABSTRACT

Market makers play an important role in providing liquidity to markets by continuously quoting prices at which they are willing to buy and sell, and managing inventory risk. In this paper, we build a multi-agent simulation of a dealer market and demonstrate that it can be used to understand the behavior of a reinforcement learning (RL) based market maker agent. We use the simulator to train an RL-based market maker agent with different competitive scenarios, reward formulations and market price trends (drifts). We show that the reinforcement learning agent is able to learn about its competitor's pricing policy; it also learns to manage inventory by smartly selecting asymmetric prices on the buy and sell sides (skewing), and maintaining a positive (or negative) inventory depending on whether the market price drift is positive (or negative). Finally, we propose and test reward formulations for creating risk averse RL-based market maker agents.

研究动机与目标

  • 开发一个用于研究场外(柜台交易)市场中基于强化学习的做市行为的逼真多智能体仿真环境。
  • 探究RL智能体在部分可观测条件下,如何学习竞争性定价策略与库存管理。
  • 评估不同奖励设计对基于RL的做市商风险规避与库存控制的影响。
  • 理解市场价格漂移如何影响RL智能体的最优库存定位与价格偏移行为。
  • 设计并测试风险惩罚函数,以生成更稳定、更具风险规避性的做市策略。

提出的方法

  • 将做市商市场形式化为一个多智能体系统,包含相互作用的做市商与投资者智能体,仅可观测直接交易数据。
  • 基于均值-方差优化实现一个自适应做市商智能体,作为RL智能体的现实竞争对手。
  • 使用深度Q网络(DQN)训练RL智能体,状态表示包含库存、中间价与订单流。
  • 设计包含库存风险惩罚项(如二次和指数惩罚)的奖励函数,以鼓励风险规避行为。
  • 模拟多种竞争场景:持续性、随机性与自适应竞争者,采用不同定价策略。
  • 使用时间离散化环境,每轮滚动包含200个时间步,以研究长期行为与收敛性。

实验结果

研究问题

  • RQ1基于对自身交易与执行结果的部分观测,RL驱动的做市商能否学习到竞争做市商的定价策略?
  • RQ2RL智能体如何根据库存水平与市场漂移调整其买卖价差与价格偏移?
  • RQ3通过风险惩罚项进行奖励设计,在多大程度上可降低库存波动性并稳定头寸规模?
  • RQ4市场价格漂移如何影响RL智能体的最优库存位置?
  • RQ5RL智能体能否通过维持方向性库存头寸来利用正向或负向漂移?

主要发现

  • RL智能体成功通过仅观察自身交易与执行结果,推断出竞争自适应做市商的定价策略。
  • RL智能体自主发展出价格偏移行为——当库存为负时降低买入价差,当库存为正时降低卖出价差,且未接受显式偏差或先验指令。
  • 在正漂移(μ = 1)下,RL智能体学习积累大量正向库存(500个时间步内均值 = 16.06);在负漂移(μ = -1)下则持有负向库存(均值 = -16.06),展现出对市场趋势的动态适应能力。
  • 在奖励信号中引入风险惩罚函数后,库存与库存损益的标准差降低,绝对均值库存减少,证实了风险规避设计的有效性。
  • RL智能体在多次训练运行中均实现策略学习收敛,对持续性与自适应竞争者均表现出稳定性能。
  • 该智能体在不同市场条件下表现稳健,表明其对不同漂移水平与竞争行为具有良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。