Skip to main content
QUICK REVIEW

[论文解读] Using Machine Learning and Alternative Data to Predict Movements in Market Risk

Thomas Dierckx, Jesse Davis|arXiv (Cornell University)|Sep 16, 2020
Stock Market Forecasting Methods被引用 4
一句话总结

本文研究了机器学习模型是否能够利用定量市场数据以及谷歌新闻和维基百科页面浏览量等替代数据源,预测苹果公司市场隐含波动率的日度变动。尽管仅使用市场数据的模型预测准确度最高(支持向量机模型达到64.2%的平衡准确率),但研究揭示了维基百科流量与隐含波动率之间存在非线性关系,表明通过更优的特征工程或非线性算法可进一步提升模型性能。

ABSTRACT

Using machine learning and alternative data for the prediction of financial markets has been a popular topic in recent years. Many financial variables such as stock price, historical volatility and trade volume have already been through extensive investigation. Remarkably, we found no existing research on the prediction of an asset's market implied volatility within this context. This forward-looking measure gauges the sentiment on the future volatility of an asset, and is deemed one of the most important parameters in the world of derivatives. The ability to predict this statistic may therefore provide a competitive edge to practitioners of market making and asset management alike. Consequently, in this paper we investigate Google News statistics and Wikipedia site traffic as alternative data sources to quantitative market data and consider Logistic Regression, Support Vector Machines and AdaBoost as machine learning models. We show that movements in market implied volatility can indeed be predicted through the help of machine learning techniques. Although the employed alternative data appears to not enhance predictive accuracy, we reveal preliminary evidence of non-linear relationships between features obtained from Wikipedia page traffic and movements in market implied volatility.

研究动机与目标

  • 确定机器学习是否能够预测苹果股票市场隐含波动率的次日变动方向。
  • 评估替代数据(特别是谷歌新闻计数和维基百科页面浏览量)对预测性能的影响。
  • 评估替代数据特征与隐含波动率之间是否存在非线性关系。
  • 探索在仅使用有限期权数据的情况下,利用机器学习模型预测波动率变动的可行性。
  • 为未来研究识别目标构建与模型校准方面的潜在改进方向。

提出的方法

  • 采用滑动窗口的向前验证方法,使用379天的训练窗口和一天的样本外预测,共产生106个测试案例。
  • 从定量市场数据(如收益率、波动率、交易量)、谷歌新闻计数和维基百科页面浏览量中提取特征。
  • 应用三种机器学习模型:逻辑回归、RBF核支持向量机和AdaBoost,均采用scikit-learn的默认配置。
  • 由于目标变量存在类别不平衡(59%下跌,41%上涨),使用平衡准确率评估性能。
  • 在五种数据源场景下进行消融研究:仅市场数据、市场+谷歌新闻、市场+维基百科、市场+两者、市场+两者+额外特征。
  • 通过分析预测概率与精确度及变动幅度的相关性,探索模型置信度。

实验结果

研究问题

  • RQ1机器学习模型能否预测苹果股票市场隐含波动率的次日变动方向?
  • RQ2与仅使用定量市场数据相比,整合替代数据(谷歌新闻和维基百科)是否能提升预测准确率?
  • RQ3维基百科流量特征与隐含波动率变动之间是否存在线性模型可能忽略的非线性关系?
  • RQ4类别不平衡如何影响模型性能?平衡准确率是否提供更可靠的评估指标?
  • RQ5模型置信度评分(预测概率)能否用于识别更精确的预测,或与变动幅度相关?

主要发现

  • 仅使用定量市场数据时达到最佳预测性能,使用RBF核支持向量机模型的平衡准确率为64.2%。
  • 谷歌新闻计数的引入在所有模型中均导致性能下降,表明该数据源的预测价值有限。
  • 维基百科页面浏览量与隐含波动率变动之间存在非线性关系,这从AdaBoost在包含这些特征时优于其他模型中得到证实。
  • 逻辑回归在使用维基百科特征时表现较差,表明该关系可能具有非线性特征,更适合由集成方法捕捉。
  • 使用替代数据的最佳整体结果为63.0%的平衡准确率,采用AdaBoost模型结合市场与维基百科特征,但仍低于仅使用市场数据的基线。
  • 将所有数据源组合并未带来显著改进,表明特征噪声或模型局限性可能在小样本数据集上阻碍泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。