Skip to main content
QUICK REVIEW

[论文解读] A Novel Deep Reinforcement Learning Based Automated Stock Trading System Using Cascaded LSTM Networks

Jie Zou, Jiashu Lou|arXiv (Cornell University)|Dec 6, 2022
Stock Market Forecasting Methods被引用 4
一句话总结

该论文提出了一种级联LSTM正则化的近端策略优化(CLSTM-PPO)模型,用于自动化股票交易,通过堆叠LSTM从金融时间序列中提取时序特征,再进行策略优化。与基线模型相比,该模型在累计收益上提升5%–52%,最大收益率提升8%–52%,在新兴市场(如中国市场)表现尤为突出,累计收益提升84.4%,夏普比率提升37.4%。

ABSTRACT

More and more stock trading strategies are constructed using deep reinforcement learning (DRL) algorithms, but DRL methods originally widely used in the gaming community are not directly adaptable to financial data with low signal-to-noise ratios and unevenness, and thus suffer from performance shortcomings. In this paper, to capture the hidden information, we propose a DRL based stock trading system using cascaded LSTM, which first uses LSTM to extract the time-series features from stock daily data, and then the features extracted are fed to the agent for training, while the strategy functions in reinforcement learning also use another LSTM for training. Experiments in DJI in the US market and SSE50 in the Chinese stock market show that our model outperforms previous baseline models in terms of cumulative returns and Sharp ratio, and this advantage is more significant in the Chinese stock market, a merging market. It indicates that our proposed method is a promising way to build a automated stock trading system.

研究动机与目标

  • 解决金融时间序列中信噪比低和非平稳性带来的挑战,这些因素阻碍了深度强化学习(DRL)在股票交易中的直接应用。
  • 克服监督学习方法在金融预测中的局限性,如过拟合和对标注市场状态的依赖。
  • 开发一种基于DRL的自动化交易系统,能够动态学习最优的买入/卖出动作,而无需预标注的市场方向标签。
  • 通过将级联LSTM的时间序列特征提取整合到DRL框架中,提升模型的泛化能力和盈利能力。
  • 在不同市场(美国、中国、印度、英国)评估模型,以检验其在发达市场和新兴市场中的鲁棒性与性能。

提出的方法

  • 采用级联LSTM(CLSTM)架构,从日频股票数据中提取分层时序特征,包括价格、成交量以及技术指标(MACD、RSI、CCI、ADX)。
  • 将提取的特征作为马尔可夫决策过程(MDP)框架中近端策略优化(PPO)智能体的初始状态表示。
  • 将交易任务建模为MDP,其中状态由调整后的价格、现金余额、持股数量和技术指标定义。
  • 使用基于投资组合收益的奖励函数训练PPO智能体,通过夏普比率归一化潜在提升风险与收益的平衡。
  • 实施多智能体集成策略作为基线比较,确保训练环境和评估指标的一致性。
  • 使用最少7年的历史数据窗口,以确保训练稳定性,尤其适用于长周期DRL策略学习。

实验结果

研究问题

  • RQ1级联LSTM架构能否有效从噪声大、非平稳的金融时间序列中提取有意义的时序模式,从而提升基于DRL的交易策略学习效果?
  • RQ2在多个全球市场中,CLSTM-PPO模型与现有DRL及集成学习策略相比,在累计收益、风险调整后表现及单笔交易盈利能力方面表现如何?
  • RQ3该模型在发达市场与新兴市场中的表现优势是否存在显著差异,特别是在中国A股市场等高波动性环境中?
  • RQ4基于LSTM的特征提取集成在多大程度上增强了智能体在自动化交易强化学习中的泛化能力并避免过拟合?
  • RQ5奖励函数归一化(如使用夏普比率)是否能提升训练稳定性并降低最大回撤,同时不牺牲收益潜力?

主要发现

  • 在所有测试市场中,CLSTM-PPO模型的累计收益较基线模型提升5%至52%,其中中国市场提升最为显著,累计收益增长84.4%。
  • 最大收益率较基线提升8%至52%,表明在趋势市中具备更强的盈利捕捉能力。
  • 单笔交易平均盈利能力提升6%至14%,表明单笔交易决策质量更高。
  • 与集成基线相比,中国市场的夏普比率提升37.4%,表明在新兴市场中风险调整后表现更优。
  • 在四个市场中,该模型在平均权益回报率(MER)和单笔平均利润(APPT)上均排名第一,证实了级联LSTM在特征提取中的有效性。
  • 英国市场表现受限,因训练数据不足(少于7年),表明长周期DRL训练需要大量历史数据以实现最优收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。