Skip to main content
QUICK REVIEW

[论文解读] A Tweet-based Dataset for Company-Level Stock Return Prediction

Karolina Sowinska, Pranava Madhyastha|arXiv (Cornell University)|Jun 17, 2020
Stock Market Forecasting Methods被引用 4
一句话总结

本文引入了一个公开的、涵盖862,231条英文推文的公司级数据集,这些推文针对1天、2天、3天和7天的股票收益率方向进行了标注,使机器学习模型能够利用社交媒体情绪预测股价走势。研究结果表明,结合BERT、fastText和词袋(BoW)特征的多视角学习方法可提高预测准确率,尤其在3天收益率预测方面表现突出,多视角方法的F1得分峰值达到0.61。

ABSTRACT

Public opinion influences events, especially related to stock market movement, in which a subtle hint can influence the local outcome of the market. In this paper, we present a dataset that allows for company-level analysis of tweet based impact on one-, two-, three-, and seven-day stock returns. Our dataset consists of 862, 231 labelled instances from twitter in English, we also release a cleaned subset of 85, 176 labelled instances to the community. We also provide baselines using standard machine learning algorithms and a multi-view learning based approach that makes use of different types of features. Our dataset, scripts and models are publicly available at: https://github.com/ImperialNLP/stockreturnpred.

研究动机与目标

  • 通过利用Twitter上的社交媒体情绪来填补公司特定股票收益率预测的空白。
  • 提供一个标注完整、公开可访问的数据集,用于精细化的公司级股价走势预测。
  • 评估使用多种自然语言处理与机器学习技术从文本中提取的特征在预测中的有效性。
  • 对单视角与多视角学习方法进行基准测试,以提升股票收益率方向预测的准确性。

提出的方法

  • 该数据集包含862,231条与公司级股票收益率(1天、2天、3天和7天)相关的已标注英文推文。
  • 通过词袋(BoW)、fastText和BERT嵌入提取文本特征,以捕捉词汇、子词和上下文信息。
  • 使用TextBlob和自定义的LSTM情感分类器测量情感极性。
  • 多视角学习框架通过典型相关分析(CCA)整合多种特征表示,再输入自动化机器学习流水线。
  • 研究采用80:20的训练-测试划分,并使用不同收益率预测周期的准确率评估模型性能。
  • 基线模型包括标准机器学习算法,以及将不同特征视图投影结果拼接的多视角学习方法。

实验结果

研究问题

  • RQ1推文层面的情感和文本内容是否能够有效预测公司层面在短期至中期周期内的股票收益率方向?
  • RQ2与单视角模型相比,引入多视角文本特征(如BERT、fastText、BoW)在股票收益率预测中的表现有何提升?
  • RQ3使用NLP特征进行基于推文的股票收益率预测时,最优预测周期(1天、2天、3天或7天)是什么?
  • RQ4与基于情感信息的模型相比,仅依靠财务指标、新闻数量和社会媒体活跃度能否有效预测股票收益率方向?
  • RQ5通过多视角学习将多种NLP特征表示进行组合,是否能获得优于单一表示的预测性能?

主要发现

  • 结合fastText和BERT特征的多视角学习方法在预测7天股票收益率方向时达到最高准确率0.64。
  • 在3天收益率预测中,使用BoW和fastText特征的多视角模型准确率达到0.61,优于单视角基线模型。
  • 表现最佳的单视角模型(使用BERT)在1天收益率预测中达到0.53的准确率,略高于BoW和fastText模型。
  • 在第三个基准模型中引入情感信息后,预测准确率相比仅依赖数据量指标的模型(基准2)有所提升。
  • 结果表明,多视角学习能有效捕捉不同NLP表示之间的互补信息,从而增强中期股价走势预测的预测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。