Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning for Active High Frequency Trading

Antonio Briola, Jeremy Turiel|arXiv (Cornell University)|Jan 18, 2021
Stock Market Forecasting Methods参考文献 47被引用 6
一句话总结

本论文提出首个基于限价订单簿(LOB)数据的端到端深度强化学习(DRL)框架,采用近端策略优化(PPO)算法实现主动高频交易。在为期三个月的英特尔股票数据上,通过信号优化采样进行训练,该框架在样本外实现了稳定的正收益,证明了DRL能够在奖励稀疏、市场影响有限且高度随机、非平稳的环境中,有效利用市场瞬时无效性。

ABSTRACT

We introduce the first end-to-end Deep Reinforcement Learning (DRL) based framework for active high frequency trading in the stock market. We train DRL agents to trade one unit of Intel Corporation stock by employing the Proximal Policy Optimization algorithm. The training is performed on three contiguous months of high frequency Limit Order Book data, of which the last month constitutes the validation data. In order to maximise the signal to noise ratio in the training data, we compose the latter by only selecting training samples with largest price changes. The test is then carried out on the following month of data. Hyperparameters are tuned using the Sequential Model Based Optimization technique. We consider three different state characterizations, which differ in their LOB-based meta-features. Analysing the agents' performances on test data, we argue that the agents are able to create a dynamic representation of the underlying environment. They identify occasional regularities present in the data and exploit them to create long-term profitable trading strategies. Indeed, agents learn trading strategies able to produce stable positive returns in spite of the highly stochastic and non-stationary environment.

研究动机与目标

  • 开发并验证一个面向真实金融市场主动高频交易的端到端深度强化学习框架。
  • 探究不同状态表示方式(尤其是包含盯市损益P&L的表示)在非平稳、高噪声环境下的代理性能影响。
  • 评估DRL代理是否能在奖励稀疏且市场影响有限的条件下,学习到盈利且动态的交易策略。
  • 提供实证证据,证明临时市场无效性确实存在,并可借助先进的强化学习技术系统性地加以利用。

提出的方法

  • 在英特尔公司股票的连续三个月高频限价订单簿数据上,使用近端策略优化(PPO)算法训练DRL代理。
  • 通过仅选择价格变动最大的时段,构建信号优化的训练集,以提升信噪比。
  • 采用序列模型基于优化(SMBO)进行超参数调优,以增强学习的稳定性和性能。
  • 基于LOB元特征定义三种不同的状态表示,其中一种包含代理当前盯市损益(P&L)。
  • 采用持续学习范式,将最后一个月的数据作为验证集,下一个月作为测试集。
  • 应用奖励塑形策略,仅在头寸平仓时提供反馈,以反映真实交易成本和动态特征。

实验结果

研究问题

  • RQ1DRL代理是否能在高度随机且非平稳的高频交易环境中,学习到盈利且动态的交易策略?
  • RQ2在状态表示中引入盯市损益P&L,对DRL交易代理的性能和盈利能力有何影响?
  • RQ3DRL代理在限价订单簿数据中,能在多大程度上利用瞬时市场无效性,实现稳定的正收益?
  • RQ4不同的基于LOB的状态表征方式,如何影响DRL代理的样本外表现和鲁棒性?
  • RQ5在考虑买卖价差和稀疏奖励信号的前提下,DRL代理是否能持续优于被动市场基准?

主要发现

  • DRL代理在整个测试期间实现了稳定的正净收益,即使在缺乏价格可预测性的情况下,也持续优于被动市场基准。
  • 在状态表示中可访问当前盯市损益P&L的代理,实现了显著更高的累计收益和更优的交易执行质量。
  • 交易次数而非单笔交易表现,是不同状态表示下整体盈利能力差异的主要驱动因素。
  • 代理展示了识别并利用限价订单簿数据中偶发规律性和瞬时无效性的能力,即使在存在强反馈回路和非线性动态的条件下亦然。
  • 该框架对奖励稀疏性表现出鲁棒性,代理能够学习在数十至数千个时间步后才平仓,表明具备有效的长期规划能力。
  • 结果为市场有效性强形式假说提供了实证反证,表明在微观结构数据中,短期可利用的无效性依然存在。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。