Skip to main content
QUICK REVIEW

[论文解读] Machine Learning for Better Models for Predicting Bond Prices

Swetava Ganguli, Jared Dunnmon|arXiv (Cornell University)|Mar 31, 2017
Stock Market Forecasting Methods参考文献 1被引用 10
一句话总结

本文提出了一种混合机器学习方法,利用历史交易数据预测债券价格,结合监督学习模型与时间序列分析以提升准确性和速度。结果表明,通过价格差异构建的基于ARMA(1,1)的特征显著提升了模型性能,其中神经网络与广义线性模型在速度与准确性之间达到最佳平衡,测试误差降低至73¢以下,耗时不足2小时。

ABSTRACT

Bond prices are a reflection of extremely complex market interactions and policies, making prediction of future prices difficult. This task becomes even more challenging due to the dearth of relevant information, and accuracy is not the only consideration--in trading situations, time is of the essence. Thus, machine learning in the context of bond price predictions should be both fast and accurate. In this course project, we use a dataset describing the previous 10 trades of a large number of bonds among other relevant descriptive metrics to predict future bond prices. Each of 762,678 bonds in the dataset is described by a total of 61 attributes, including a ground truth trade price. We evaluate the performance of various supervised learning algorithms for regression followed by ensemble methods, with feature and model selection considerations being treated in detail. We further evaluate all methods on both accuracy and speed. Finally, we propose a novel hybrid time-series aided machine learning method that could be applied to such datasets in future work.

研究动机与目标

  • 解决因市场数据有限且延迟而导致难以实时预测债券价格的挑战。
  • 开发适用于实时交易环境的快速且准确的机器学习模型。
  • 通过整合时间序列分析与传统监督学习方法,提升预测性能。
  • 评估不同算法在模型准确性与计算效率之间的权衡。
  • 探索神经网络与集成方法在高维金融预测任务中的潜力。

提出的方法

  • 作者使用包含762,678只债券、61个属性的数据集,包括历史交易价格与基于曲线的估算值。
  • 采用主成分分析(PCA)与相关性分析等特征选择技术,识别相关预测变量并降低维度。
  • 评估广义线性模型(GLMs)、回归树、支持向量回归(SVR)以及集成方法(Bagging、LS-Boosting、随机森林)在回归任务中的表现。
  • 提出一种新颖的混合方法:对每类债券的交易价格与曲线价格之间的差异拟合ARMA(1,1)模型,并将一步预测值作为新特征引入GLM模型。
  • 训练具有单隐藏层与Levenberg-Marquardt优化的神经网络,以评估非线性拟合能力。
  • 使用斯坦福高性能计算集群评估模型性能,指标包括准确度(测试误差)与训练时间。

实验结果

研究问题

  • RQ1对价格差异进行时间序列建模是否能提升传统回归模型在债券定价中的预测能力?
  • RQ2在高维债券价格预测任务中,不同机器学习算法在准确度与计算效率方面的表现如何比较?
  • RQ3使用基于ARMA的预测进行特征增强是否能带来可测量的泛化性能提升与误差降低?
  • RQ4在本金融数据集上,神经网络在准确度与训练时间方面是否显著优于经典模型?
  • RQ5考虑到大规模数据集与计算成本,集成方法是否能显著提升性能,超越单一模型?

主要发现

  • 引入基于ARMA(1,1)的特征后,测试误差相比仅使用债券ID降低了2.3¢,表明时间序列特征具有独特的解释能力。
  • 广义线性模型(GLMs)在计算成本极低的情况下表现优异,单节点计算仅耗时数秒。
  • 两层神经网络在约2小时内将测试误差降低至73¢,展现出高准确度与合理的训练时间。
  • 随机森林与LS-Boosting等集成方法未显著提升性能,且计算资源消耗显著增加。
  • 将ARMA预测结果作为特征的混合方法同时降低了训练误差与测试误差,证实该方法在捕捉动态价格行为方面的有效性。
  • 神经网络与GLMs共同实现了速度与准确度的最佳平衡,因此最适用于实时交易应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。