[论文解读] A comparative study of Different Machine Learning Regressors For Stock Market Prediction
本研究评估了九种机器学习回归模型,利用来自十家不同行业的纳斯达克上市公司历史数据,预测次日开盘股价。梯度提升回归模型表现最佳,R²达到0.96,均方误差(MSE)最低,在预测股票市场指数方面优于随机森林和XGBoost等模型。
For the development of successful share trading strategies, forecasting the course of action of the stock market index is important. Effective prediction of closing stock prices could guarantee investors attractive benefits. Machine learning algorithms have the ability to process and forecast almost reliable closing prices for historical stock patterns. In this article, we intensively studied NASDAQ stock market and targeted to choose the portfolio of ten different companies belongs to different sectors. The objective is to compute opening price of next day stock using historical data. To fulfill this task nine different Machine Learning regressor applied on this data and evaluated using MSE and R2 as performance metric.
研究动机与目标
- 评估多种机器学习回归模型在预测次日股票开盘价方面的有效性。
- 在九种不同算法中识别出在预测股票市场指数方面最准确的模型。
- 使用均方误差(MSE)和决定系数(R²)等标准指标,分析模型在真实历史股票数据上的表现。
- 评估机器学习模型在预测纳斯达克指数内不同行业股票趋势时的鲁棒性。
- 为未来基于监督学习的金融时间序列预测研究提供比较基准。
提出的方法
- 收集了十家不同行业纳斯达克上市公司历史日度股价数据(开盘价、最高价、最低价、收盘价、成交量)。
- 通过特征归一化和缺失值处理对数据进行预处理,以确保模型兼容性。
- 训练了九种监督学习回归模型:线性回归、岭回归、套索回归、弹性网络回归、随机森林、梯度提升回归、XGBoost、LightGBM和CatBoost。
- 采用滑动窗口方法,基于过去5至10天的数据生成输入特征,用于预测次日开盘价。
- 使用从时间序列中划分出的测试集,通过均方误差(MSE)和决定系数(R²)评估模型性能。
- 应用五折时间序列交叉验证,以确保模型评估的稳健性并减少过拟合。
实验结果
研究问题
- RQ1在预测纳斯达克指数成分股次日开盘价方面,哪种机器学习回归模型表现最佳?
- RQ2传统线性模型与集成树基模型在股票价格预测任务中的表现如何比较?
- RQ3在高波动性的金融时间序列中,模型复杂度在多大程度上影响预测准确性?
- RQ4与原始价格数据相比,基于技术指标的特征工程是否能提升模型性能?
- RQ5在纳斯达克指数的不同行业和个股中,模型性能排名的稳定性如何?
主要发现
- 梯度提升回归模型取得了最高的R²得分0.96,表明其对次日开盘价方差具有强大的解释能力。
- 该模型在所有九种模型中记录到最低的均方误差(MSE),证实其具有卓越的预测准确性。
- XGBoost和LightGBM表现出色,R²值超过0.94,证明梯度提升树在金融预测中的有效性。
- 线性模型如岭回归和套索回归表现欠佳,R²值低于0.85,凸显其在捕捉股票数据非线性模式方面的局限性。
- 随机森林和CatBoost表现中等,R²得分介于0.90至0.93之间,表明其具备合理但非最优的性能。
- 模型表现因行业而异,科技和医疗保健类股票的走势更具可预测性,而可选消费和金融类股票则表现更不稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。