Skip to main content
QUICK REVIEW

[论文解读] Model-based Reinforcement Learning for Predictions and Control for Limit Order Books

Haoran Wei, Yuanbo Wang|arXiv (Cornell University)|Oct 9, 2019
Stock Market Forecasting Methods参考文献 29被引用 13
一句话总结

该论文提出了一种基于模型的强化学习框架,完全基于历史订单簿数据训练交易智能体,利用学习到的环境模型模拟市场动态,并在无需实时交互的情况下优化交易策略。该方法在真实市场中实现了盈利且可迁移的策略,在多种市场环境下表现出稳健性能,相较于基线策略,样本效率和稳定性均有提升。

ABSTRACT

We build a profitable electronic trading agent with Reinforcement Learning that places buy and sell orders in the stock market. An environment model is built only with historical observational data, and the RL agent learns the trading policy by interacting with the environment model instead of with the real-market to minimize the risk and potential monetary loss. Trained in unsupervised and self-supervised fashion, our environment model learned a temporal and causal representation of the market in latent space through deep neural networks. We demonstrate that the trading policy trained entirely within the environment model can be transferred back into the real market and maintain its profitability. We believe that this environment model can serve as a robust simulator that predicts market movement as well as trade impact for further studies.

研究动机与目标

  • 开发一种基于模型的强化学习框架,学习盈利的交易策略,且无需与金融市场进行实时交互。
  • 构建一个数据驱动的环境模型,通过潜在空间中的自监督表征学习,捕捉订单簿的时间和因果动态。
  • 实现在模拟环境中训练的策略向真实市场的稳定迁移,保持持续盈利。
  • 解决模型无关强化学习在金融领域中的局限性,如高样本复杂度和试错训练带来的风险。
  • 提供一个稳健、通用的模拟器,用于预测电子交易中的市场走势和交易影响。

提出的方法

  • 该框架使用深度神经网络从历史数据中学习订单簿的潜在空间表征,捕捉时间依赖性和因果关系。
  • 通过对比学习以自监督方式训练世界模型,从当前观测和动作中预测未来状态和奖励。
  • 强化学习智能体仅在学习到的环境模型中进行训练,使用策略梯度(PG)、A2C或DQN算法优化交易策略。
  • 模型端到端学习状态转移和奖励信号的表征,实现对市场演化和交易影响的联合预测。
  • 通过将策略迁移至真实市场数据进行评估,比较不同市场环境下的累计损益(PnL)。
  • 该系统设计为样本高效且稳健,最大限度减少训练期间对真实市场风险的暴露。

实验结果

研究问题

  • RQ1基于模型的强化学习智能体能否仅使用历史订单簿数据且无需与真实环境实时交互,学习到盈利的交易策略?
  • RQ2自监督的世界模型在多大程度上能捕捉订单簿的时间和因果动态,以支持有效的策略训练?
  • RQ3在模拟环境中训练的策略在多大程度上可成功迁移至真实市场条件并保持盈利?
  • RQ4该基于模型的强化学习智能体在不同市场环境下的表现,与传统基线策略(如动量策略、分类器策略)相比如何?
  • RQ5该方法在低数据环境下(如趋势信号有限的震荡市场)存在哪些局限性?

主要发现

  • 仅在环境模型中训练的强化学习智能体,其累计损益表现达到贪婪最优解的10%–30%,且平均表现优于动量策略和分类器策略基线。
  • A2C算法表现比PG和DQN更稳定,DQN表现较差,原因在于状态表征不够理想。
  • 分类器策略表现不佳,主要由于类别不平衡,频繁将价格走势误判为“无变化”,导致行动次数过少。
  • 强化学习智能体在上升和下降市场中表现强劲,但在震荡市场中表现欠佳,原因在于训练数据不足(约占总数据的15.8%)。
  • 在世界模型中训练的策略成功迁移至真实市场环境,在五个随机选取的交易日内表现出渐近一致的性能。
  • 环境模型有效预测了市场走势和交易影响,验证了其作为未来研究中稳健模拟器的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。