Skip to main content
QUICK REVIEW

[论文解读] Deep Fundamental Factor Models

Matthew Dixon, Nicholas G. Polson|arXiv (Cornell University)|Mar 18, 2019
Stock Market Forecasting Methods参考文献 37被引用 5
一句话总结

该论文提出深度基础因子(DFF)模型,利用深度神经网络捕捉资产定价中的非线性关系与交互效应,通过因子敏感度的有界方差实现不确定性量化。该方法相较普通最小二乘法(OLS)的信息比率提升1.5倍,且在异常值鲁棒性方面优于LASSO,同时通过基于敏感度的置信区间与因子重要性排序实现可解释性。

ABSTRACT

Deep fundamental factor models are developed to automatically capture non-linearity and interaction effects in factor modeling. Uncertainty quantification provides interpretability with interval estimation, ranking of factor importances and estimation of interaction effects. With no hidden layers we recover a linear factor model and for one or more hidden layers, uncertainty bands for the sensitivity to each input naturally arise from the network weights. Using 3290 assets in the Russell 1000 index over a period of December 1989 to January 2018, we assess a 49 factor model and generate information ratios that are approximately 1.5x greater than the OLS factor model. Furthermore, we compare our deep fundamental factor model with a quadratic LASSO model and demonstrate the superior performance and robustness to outliers. The Python source code and the data used for this study are provided.

研究动机与目标

  • 开发一种用于基础因子建模的深度学习框架,以克服传统神经网络在可解释性方面的局限性。
  • 通过网络权重的有界方差实现因子敏感度的不确定性量化,支持有效的统计推断。
  • 以一种可解释且可扩展至高维数据的方式,对因子重要性进行排序并检测交互效应。
  • 通过捕捉非线性关系与对异常值的敏感性,提升资产定价的预测性能,超越线性或基于LASSO的模型。
  • 通过引入具有统计可解释性的非线性深度架构,对OLS与Barra等线性因子模型进行泛化。

提出的方法

  • 使用一个或多个隐藏层的深度神经网络,将资产收益建模为基本面因子的函数,激活函数采用ReLU或tanh。
  • 应用基于权重的不确定性量化方法,推导因子敏感度的有界置信区间,确保方差有限并支持有效推断。
  • 采用基于敏感度的可解释性方法,通过网络权重的分布对因子重要性进行排序,并检测交互效应。
  • 在1989年12月至2018年1月期间,基于3,290只Russell 1000股票的49因子模型进行训练,采用反向传播与正则化方法。
  • 通过信息比率、行业偏离度与因子敏感度分布,与OLS及二次LASSO模型进行性能对比。
  • 对因子敏感度分布应用自助法置信区间,利用从权重乘积中推导出的理论方差界。

实验结果

研究问题

  • RQ1在基本面因子建模背景下,能否使深度神经网络在保持其非线性表达能力的同时具备可解释性?
  • RQ2在深度因子模型中引入隐藏层,对因子敏感度的不确定性量化有何影响?
  • RQ3与OLS等线性模型相比,深度基础因子模型在多大程度上提升了信息比率?
  • RQ4在捕捉资产收益中的交互效应与处理异常值方面,深度模型相较于基于LASSO的模型表现如何?
  • RQ5能否从网络权重中推导出因子敏感度方差的理论界,从而在深度学习模型中实现稳健的统计推断?

主要发现

  • 深度基础因子模型在所有测试投资组合中,信息比率约为OLS线性模型的1.5倍。
  • 该模型的敏感度分布具有有界方差,支持有效的自助法置信区间与稳健的不确定性量化。
  • 尽管四分位距相近,该模型在捕捉异常值敏感度方面优于LASSO,表现为敏感度分布的更大变异性。
  • 根据中位数敏感度排序,收益/价格(E/P)、预期收益/价格(FE/P)与销售额/企业价值(S/EV)是模型中最重要的三个因子。
  • LASSO模型中交互效应更明显,但深度模型更能捕捉非线性关系与极端收益事件。
  • 深度模型的行业偏离度与OLS在平均暴露水平上相近,但对高账面市值比、收益/价格及现金流波动率/总资产的偏离更强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。