[论文解读] Extending Deep Reinforcement Learning Frameworks in Cryptocurrency Market Making
本文提出了一种基于价格的事件驱动强化学习框架,用于加密货币做市,以价格变动触发替代传统的基于时间或成交次数的事件。在Bitmex订单簿数据上使用A2C和PPO算法,该方法在利润和稳定性方面表现更优,尤其在TC奖励函数下,相较于基于时间的基线方法,在七种奖励函数和30天的样本外测试中均表现更佳。
There has been a recent surge in interest in the application of artificial intelligence to automated trading. Reinforcement learning has been applied to single- and multi-instrument use cases, such as market making or portfolio management. This paper proposes a new approach to framing cryptocurrency market making as a reinforcement learning challenge by introducing an event-based environment wherein an event is defined as a change in price greater or less than a given threshold, as opposed to by tick or time-based events (e.g., every minute, hour, day, etc.). Two policy-based agents are trained to learn a market making trading strategy using eight days of training data and evaluate their performance using 30 days of testing data. Limit order book data recorded from Bitmex exchange is used to validate this approach, which demonstrates improved profit and stability compared to a time-based approach for both agents when using a simple multi-layer perceptron neural network for function approximation and seven different reward functions.
研究动机与目标
- 解决强化学习用于做市时,对延迟敏感的基于时间或成交次数的事件环境的局限性。
- 提出并评估一种新型基于价格的事件环境,其中智能体仅在发生显著价格变动时采取行动。
- 在深度强化学习框架中,比较多种奖励函数在自动化做市中的表现。
- 在DRLMM框架基础上,引入一种更稳定、更智能的策略,以减少高频订单簿数据带来的噪声影响。
提出的方法
- 该框架采用马尔可夫决策过程(MDP),状态空间基于Level II订单簿数据构建,包括订单流失衡及衍生指标。
- 使用基于策略的深度强化学习算法(A2C和PPO)进行训练,函数逼近采用多层感知机。
- 环境定义为基于价格的事件——仅当价格变动超过阈值时才触发行动,从而减少非显著价格波动带来的噪声。
- 评估了七种不同的奖励函数:UPnL、UPnLwF、Asym、AsymC、ΔRPnL、TC和DSR,每种函数引导智能体朝向不同的风险-收益目标。
- 训练使用Bitmex订单簿数据中的八天(100万步),评估则在30天样本外数据上进行,以衡量泛化能力和盈利能力。
- 通过累计收益、损益及稳定性指标,在多个实验组中衡量性能表现。
实验结果
研究问题
- RQ1在加密货币做市中,基于价格的事件环境相较于基于时间或成交次数的事件环境,在智能体盈利能力与稳定性方面表现如何?
- RQ2在七种奖励函数中,哪一种在基于时间与基于价格的事件设置下,能产生最稳健且盈利最高的交易策略?
- RQ3基于策略的深度强化学习智能体在有限历史数据训练下,能否在不同市场环境下实现泛化?
- RQ4通过价格阈值降低事件频率,是否能提升学习效率并减少高频订单簿环境下的异常交易行为?
主要发现
- 在两种事件类型下,A2C智能体在累计收益和盈利实验数量方面均优于PPO。
- TC(目标完成)奖励函数在基于时间与基于价格的环境中均产生最高收益,在基于时间的事件设置中,第3组实验达到17.61%的回报率。
- 基于价格的事件带来了更稳定的交易模式,尤其在大幅价格波动期间,显著减少了噪声引发的异常行为。
- 在84组基于价格的事件实验中,有23组实现盈利,而基于时间的环境盈利实验更少,表明学习效率更高。
- AsymC奖励函数在部分实验中表现优异,在一次基于价格的实验中实现11.88%的回报率,表明非对称风险调整策略可能有效。
- DSR(差异Sharpe比率)奖励函数结果参差不齐,多数情况下出现负收益,表明在高波动市场环境下可能存在不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。