[论文解读] Applications of deep learning in stock market prediction: recent progress
本综述回顾了2017–2019年间深度学习在股票市场预测中的最新进展,对数据来源、神经网络架构(例如LSTM、GCN、Transformer)、评估指标和实现实践进行了分类。通过提供开源代码链接强调了可复现性,并指出了未来方向,如多模态数据融合、跨市场迁移学习以及用于算法交易的深度强化学习。
Stock market prediction has been a classical yet challenging problem, with the attention from both economists and computer scientists. With the purpose of building an effective prediction model, both linear and machine learning tools have been explored for the past couple of decades. Lately, deep learning models have been introduced as new frontiers for this topic and the rapid development is too fast to catch up. Hence, our motivation for this survey is to give a latest review of recent works on deep learning models for stock market prediction. We not only category the different data sources, various neural network structures, and common used evaluation metrics, but also the implementation and reproducibility. Our goal is to help the interested researchers to synchronize with the latest progress and also help them to easily reproduce the previous studies as baselines. Base on the summary, we also highlight some future research directions in this topic.
研究动机与目标
- 提供过去三年内股票市场预测中深度学习应用的全面、最新综述。
- 将预测工作流程系统化为若干独立阶段——数据收集、处理、建模和评估——以实现对现有研究的更好分类与比较。
- 通过整理已发表论文中的开源代码和数据链接,提升研究的可复现性。
- 识别尚未充分探索的研究方向,如多模态数据整合、跨市场分析以及用于交易的深度强化学习。
- 通过提供可访问的实现资源,支持研究人员采用现有模型作为基线,从而加速创新。
提出的方法
- 将股票预测中使用的深度学习模型分类为前馈网络、卷积网络、循环网络和图神经网络,重点强调注意力机制和生成对抗网络(GANs)。
- 分析包括历史价格数据、新闻、社交媒体(如Twitter)以及股票关系知识图谱在内的多样化数据源。
- 回顾RMSE、MAE和夏普比率等评估指标,并讨论其在真实交易环境中的局限性。
- 通过整理超过20项关键研究的GitHub链接,突出实现实践,以支持可复现性和基线测试。
- 提出股票预测的结构化工作流程:数据收集 → 预处理 → 模型选择 → 训练 → 评估 → 交易模拟。
- 整合强化学习与迁移学习的见解,以建模跨市场泛化能力与动态交易策略。
实验结果
研究问题
- RQ1在最近三年中,哪些深度学习架构在股票市场预测中最为有效?它们是如何演进的?
- RQ2不同数据源——尤其是新闻和社交媒体等另类数据——在多大程度上提升了预测性能?
- RQ3现有模型在多大程度上可以被复现?开源实现在此过程中起到了什么作用?
- RQ4当前股票预测评估实践的关键局限性是什么,特别是在交易成本和市场真实性方面?
- RQ5跨市场迁移学习与多模态数据融合在多大程度上能提升股票预测模型的泛化能力与鲁棒性?
主要发现
- 注意力机制和图神经网络(如HATS、RSR)通过建模股票数据中的时序依赖与关系依赖,显著提升了性能。
- 在美股市场数据上训练的模型在其他国际市场中表现出一定的可迁移性,表明通过少量微调即可实现跨市场学习的潜力。
- 基于强化学习的策略(如深度Q网络)在回测中优于简单的买入持有或规则驱动策略,但实际部署仍具挑战。
- 通过BERT类模型整合金融新闻与社交媒体数据展现出潜力,但相较于基于价格的模型,该方向仍研究不足。
- 在所调研的研究中,超过80%的研究提供了开源代码,显著提升了可复现性,并支持模型间的公平基准比较。
- 尽管技术不断进步,大多数模型仍忽略交易成本与市场冲击,限制了其在真实交易环境中的实际可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。