Skip to main content
QUICK REVIEW

[论文解读] A Machine Learning Framework for Stock Selection

Xingyu Fu, Jin‐Hong Du|arXiv (Cornell University)|Jun 5, 2018
Stock Market Forecasting Methods参考文献 12被引用 13
一句话总结

本文提出了一种基于244个技术面与基本面特征的机器学习框架用于选股,通过堆叠(Stacking)集成随机森林(Random Forest)与深度神经网络(Deep Neural Networks)模型实现最优性能。该方法在中国股市上得到验证,AUC达到0.972,回测表现优于市场基准,且通过遗传算法(Genetic Algorithm)筛选特征,在不损失性能的前提下减少了冗余特征。

ABSTRACT

This paper demonstrates how to apply machine learning algorithms to distinguish good stocks from the bad stocks. To this end, we construct 244 technical and fundamental features to characterize each stock, and label stocks according to their ranking with respect to the return-to-volatility ratio. Algorithms ranging from traditional statistical learning methods to recently popular deep learning method, e.g. Logistic Regression (LR), Random Forest (RF), Deep Neural Network (DNN), and the Stacking, are trained to solve the classification task. Genetic Algorithm (GA) is also used to implement feature selection. The effectiveness of the stock selection strategy is validated in Chinese stock market in both statistical and practical aspects, showing that: 1) Stacking outperforms other models reaching an AUC score of 0.972; 2) Genetic Algorithm picks a subset of 114 features and the prediction performances of all models remain almost unchanged after the selection procedure, which suggests some features are indeed redundant; 3) LR and DNN are radical models; RF is risk-neutral model; Stacking is somewhere between DNN and RF. 4) The portfolios constructed by our models outperform market average in back tests.

研究动机与目标

  • 开发一个稳健的机器学习框架,用于在金融市场中区分高收益股票与低收益股票。
  • 通过整合多样化模型与有效的特征选择,应对噪声大、非平稳的金融数据挑战。
  • 不仅从统计角度评估模型性能,还通过与市场基准对比的组合回测进行实践验证。
  • 研究不同模型(如激进型、风险中性型)的风险特征,以及集成学习在选股中的有效性。

提出的方法

  • 为每只股票构建244个技术面与基本面特征,以表征其在时间维度上的财务与价格行为。
  • 基于收益波动率比率(作为夏普比率的代理指标)将股票标记为正样本(前Q%)或负样本(后Q%),以构建平衡的分类任务。
  • 应用多种模型:逻辑回归(LR)、随机森林(RF)、深度神经网络(DNN),以及堆叠模型(元学习器使用LR对RF与DNN的输出进行集成)。
  • 采用遗传算法(GA)进行全局特征子集选择,以减少冗余与计算成本。
  • 在DNN中应用正则化技术(Dropout、批归一化、L2正则化),以缓解低信噪比金融数据带来的过拟合问题。
  • 使用三重划分训练堆叠模型:Train-1与Train-2用于基模型训练(DNN使用合并数据,RF使用Train-2),Validation用于元学习器(LR)基于基模型预测结果进行训练。

实验结果

研究问题

  • RQ1能否通过技术面与基本面特征的组合,有效实现对‘优质’股票与‘劣质’股票的机器学习分类?
  • RQ2在选股任务中,不同模型(LR、RF、DNN、Stacking)在AUC、准确率与风险特征方面的表现如何比较?
  • RQ3通过遗传算法进行特征选择,在不降低预测性能的前提下,能在多大程度上提升模型效率?
  • RQ4LR、RF、DNN与Stacking模型的风险特征如何比较——是否LR与DNN更具激进性,而Stacking为平衡型混合策略?
  • RQ5基于模型预测构建的投资组合能否在样本外回测中持续超越市场指数?

主要发现

  • 堆叠模型通过逻辑回归元学习器集成随机森林与深度神经网络的预测结果,取得了最高的AUC得分0.972,优于所有单个模型。
  • 遗传算法从原始244个特征中筛选出114个特征,且模型性能无显著下降,表明初始特征集中存在大量冗余。
  • 逻辑回归与深度神经网络模型表现出高召回率与低精确率,表明其采用激进的投资策略,倾向于高信心标的。
  • 随机森林展现出精确率与召回率的平衡,暗示其为风险中性策略;而堆叠模型的性能与风险特征介于DNN与RF之间。
  • 基于模型输出构建的投资组合在多个不同起始日期(2015年、2017年、2018年)的回测中,持续优于市场平均表现。
  • 统计与实践验证流程证实,该框架在实际选股中兼具高度准确性与可操作性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。