Skip to main content
QUICK REVIEW

[论文解读] TradeR: Practical Deep Hierarchical Reinforcement Learning for Trade Execution

Karush Suri, Xiao Qi Shi|arXiv (Cornell University)|Feb 16, 2021
Adversarial Robustness in Machine Learning被引用 4
一句话总结

TradeR 提出了一种用于高频交易执行的分层深度强化学习框架,旨在应对突发市场事件(如2019年新冠疫情导致的股市暴跌)期间的灾难性损失与意外事件最小化。通过将基于能量的内在动机机制与意外值函数相结合,TradeR 在35只标普500成分股中实现了更低风险、更稳定的盈利表现。

ABSTRACT

Advances in Reinforcement Learning (RL) span a wide variety of applications which motivate development in this area. While application tasks serve as suitable benchmarks for real world problems, RL is seldomly used in practical scenarios consisting of abrupt dynamics. This allows one to rethink the problem setup in light of practical challenges. We present Trade Execution using Reinforcement Learning (TradeR) which aims to address two such practical challenges of catastrophy and surprise minimization by formulating trading as a real-world hierarchical RL problem. Through this lens, TradeR makes use of hierarchical RL to execute trade bids on high frequency real market experiences comprising of abrupt price variations during the 2019 fiscal year COVID19 stock market crash. The framework utilizes an energy-based scheme in conjunction with surprise value function for estimating and minimizing surprise. In a large-scale study of 35 stock symbols from the S&P500 index, TradeR demonstrates robustness to abrupt price changes and catastrophic losses while maintaining profitable outcomes. We hope that our work serves as a motivating example for application of RL to practical problems.

研究动机与目标

  • 为解决实际交易场景中强化学习面临的实用挑战,特别是灾难性损失与意外事件的最小化。
  • 开发一种分层强化学习框架,实现在剧烈市场动态下的稳定且盈利的交易执行。
  • 通过基于能量的机制引入内在动机,并结合意外值函数,引导风险规避型决策。
  • 在2019年新冠疫情市场暴跌期间的真实高频市场数据上评估该框架。
  • 证明持有动作与内在动机在模拟人类交易行为方面的有效性。

提出的方法

  • TradeR 采用两级分层策略:低层订单策略用于估算最优交易数量,高层出价策略根据当前市场状态执行交易。
  • 基于能量的内在动机机制实时估算意外程度,使智能体能够最小化意外的市场冲击。
  • 意外值函数作为内在奖励信号,引导智能体避免高意外状态,从而降低灾难性损失。
  • 该框架基于2019年市场暴跌期间35只标普500成分股的1分钟高频数据进行训练,采用深度Q网络进行函数逼近。
  • 智能体被赋予“持有”动作,使其在市场条件不利时可选择不交易,从而提升风险控制能力。
  • 消融实验评估了内在动机与持有动作对性能、风险及不同随机种子下一致性的影响力。

实验结果

研究问题

  • RQ1分层强化学习框架是否能有效最小化突发市场事件中的意外与灾难性损失?
  • RQ2引入基于能量的内在动机机制在高频交易中如何提升稳健性与盈利能力?
  • RQ3‘持有’动作的引入在多大程度上增强了强化学习交易智能体的稳定性与风险规避行为?
  • RQ4在不同初始资金水平与市场波动率下,TradeR 框架的表现如何?
  • RQ5内在动机机制是否导致更接近人类的交易模式,例如买入更多而卖出更少?

主要发现

  • 在2019年市场暴跌期间,TradeR 在35只标普500成分股中均表现出一致的盈利性与稳健性,即使面对剧烈价格波动也表现良好。
  • 引入‘持有’动作显著提升了性能稳定性,使智能体能够在不利市场条件下避免不必要的交易。
  • 基于能量的内在动机机制减少了总卖出股份数量,并降低了不同随机种子下的方差,表明其行为更具风险规避性。
  • 随着初始资金水平的提高,性能进一步提升,表明框架具备可扩展性与适应更高交易负荷的能力。
  • 消融实验确认,意外值函数与‘持有’动作对于最小化灾难性损失并维持稳定回报至关重要。
  • 该框架在不同随机种子下均实现了稳定的学习,表明其在高风险、高频环境中的样本效率与可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。