[论文解读] Can Machine Learning Catch Economic Recessions Using Economic and Market Sentiments?
本文利用1986年至2022年间的75项经济与市场情绪指标,评估了机器学习模型在预测美国经济衰退中的表现。通过应用ARIMA插补法、Boruta特征选择法以及交叉验证模型——包括梯度提升与神经网络——研究结果表明,集成方法在准确率与F1分数方面表现优异,其中梯度提升模型优于传统的Logit与Probit模型。
Quantitative models are an important decision-making factor for policy makers and investors. Predicting an economic recession with high accuracy and reliability would be very beneficial for the society. This paper assesses machine learning technics to predict economic recessions in United States using market sentiment and economic indicators (seventy-five explanatory variables) from Jan 1986 - June 2022 on a monthly basis frequency. In order to solve the issue of missing time-series data points, Autoregressive Integrated Moving Average (ARIMA) method used to backcast explanatory variables. Analysis started with reduction in high dimensional dataset to only most important characters using Boruta algorithm, correlation matrix and solving multicollinearity issue. Afterwards, built various cross-validated models, both probability regression methods and machine learning technics, to predict recession binary outcome. The methods considered are Probit, Logit, Elastic Net, Random Forest, Gradient Boosting, and Neural Network. Lastly, discussed different models performance based on confusion matrix, accuracy and F1 score with potential reasons for their weakness and robustness.
研究动机与目标
- 开发并评估利用丰富经济与市场情绪指标预测美国经济衰退的机器学习模型。
- 通过ARIMA反向插补法解决高维经济数据集中的时间序列缺失值问题。
- 通过Boruta算法与相关性分析减少维度并缓解多重共线性问题。
- 比较传统统计模型(Logit、Probit)与先进机器学习技术(随机森林、梯度提升、神经网络)在经济衰退预测中的表现。
- 通过混淆矩阵、准确率与F1分数,评估多种交叉验证模型的稳健性。
提出的方法
- 应用ARIMA模型对1986年1月至2022年6月间75项经济与情绪指标中的缺失值进行反向插补。
- 采用Boruta算法识别并保留最具相关性的解释变量,从而降低数据集维度。
- 进行相关性矩阵分析,并通过处理多重共线性问题以提升模型的稳定性和可解释性。
- 训练并交叉验证多种模型:Probit、Logit、Elastic Net、随机森林、梯度提升与神经网络,用于二元经济衰退预测。
- 通过混淆矩阵、准确率与F1分数评估模型性能,以比较其稳健性与预测能力。
- 采用月度频率的时间序列框架,确保预测变量在时间上的一致性与相关性。
实验结果
研究问题
- RQ1机器学习模型能否有效结合经济指标与市场情绪,实现对美国经济衰退的预测?
- RQ2与Logit与Probit等传统模型相比,梯度提升与随机森林等集成方法在经济衰退预测准确率方面表现如何?
- RQ3通过Boruta进行特征选择并减少多重共线性,能在多大程度上提升模型性能?
- RQ4ARIMA插补法在处理经济时间序列中缺失数据对机器学习建模的影响如何?
- RQ5哪种模型在检测经济衰退事件方面实现了最高的F1分数与整体稳健性?
主要发现
- 梯度提升模型在所有评估模型中取得了最高的F1分数,表明其在精确率与召回率之间实现了良好平衡,具备优异的衰退检测能力。
- Boruta算法成功识别并保留了最具信息量的特征,将数据集缩减为更易管理且相关的子集。
- ARIMA插补法有效解决了时间序列中的缺失数据点,确保了模型在整个1986–2022年期间的一致性训练。
- 神经网络与随机森林模型表现强劲,但在F1分数与稳定性方面仍不及梯度提升模型。
- 传统模型如Logit与Probit的F1分数与准确率低于集成方法,表明其在捕捉复杂非线性关系方面存在局限。
- 最终的模型选择过程表明,特征选择与多重共线性处理显著提升了模型的稳健性与预测准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。