[论文解读] Stock Embeddings: Learning Distributed Representations for Financial Assets
本文提出一种基于神经网络的方法,仅利用历史日收益率数据,通过自然语言处理中的原理学习金融资产的分布式向量表示(嵌入)。该方法在降低投资组合波动率方面优于传统的基于相关性的方法,在对冲任务中实现了21.3%的平均实现波动率,显著低于使用皮尔逊相关系数的23.8%基线值。
Identifying meaningful relationships between the price movements of financial assets is a challenging but important problem in a variety of financial applications. However with recent research, particularly those using machine learning and deep learning techniques, focused mostly on price forecasting, the literature investigating the modelling of asset correlations has lagged somewhat. To address this, inspired by recent successes in natural language processing, we propose a neural model for training stock embeddings, which harnesses the dynamics of historical returns data in order to learn the nuanced relationships that exist between financial assets. We describe our approach in detail and discuss a number of ways that it can be used in the financial domain. Furthermore, we present the evaluation results to demonstrate the utility of this approach, compared to several important benchmarks, in two real-world financial analytics tasks.
研究动机与目标
- 解决机器学习研究中侧重于价格预测而非资产关系建模的空白。
- 开发一种仅使用历史收益率数据来学习金融资产密集分布式表示的方法。
- 评估这些嵌入是否能在实际金融任务中优于传统的基于相关性的相似性度量。
- 展示嵌入在实际应用中的实用性,如投资组合对冲与行业分类。
提出的方法
- 该模型采用受Word2Vec启发的神经网络架构,从金融资产的时间序列收益率中学习嵌入。
- 在训练过程中应用负采样策略,以优化资产间收益率模式的语义相似性。
- 在历史收益率序列上定义上下文窗口,其中每个资产基于其时间邻近资产进行预测。
- 该模型学习低维密集向量,基于收益率的分布相似性编码资产之间的细微关系。
- 应用如四分位距(IQR)过滤等降噪技术,以提升鲁棒性与泛化能力。
- 使用学习到的嵌入之间的余弦相似度作为相似性度量,替代或补充传统的皮尔逊相关系数。
实验结果
研究问题
- RQ1从历史收益率中学习到的股票分布式表示是否能比传统相关性更好地捕捉资产间的有意义关系?
- RQ2在投资组合构建中,股票嵌入与皮尔逊相关系数和斯皮尔曼相关系数相比,在识别相似或相异资产方面表现如何?
- RQ3基于嵌入的相似性是否能提升双资产对冲策略在实现波动率方面的表现?
- RQ4上下文大小和嵌入维度等超参数对学习表示质量有何影响?
- RQ5通过修改上下文窗口设计,能否捕捉滞后或因果关系(如供应商效应)?
主要发现
- 所提出的嵌入方法在双资产对冲任务中实现了21.3%的平均实现波动率,显著低于使用皮尔逊相关系数的23.8%基线值。
- 与皮尔逊基线相比,基于嵌入的方法在波动率降低方面表现出统计显著性提升(α = 0.01)。
- 表现最佳的变体(结合嵌入、IQR降噪和权重归一化)在100次随机试验中实现了最低的平均波动率。
- 基于嵌入的方法所生成的投资组合波动率分布更集中于较低值,表明其具有更高的鲁棒性与一致性。
- 事后Tukey HSD检验确认,所有基于嵌入的方法产生的平均波动率均显著低于皮尔逊相关系数基线。
- 结果表明,基于嵌入的相似性度量在实际投资组合风险管理任务中可优于标准相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。