Skip to main content
QUICK REVIEW

[論文レビュー] A Tweet-based Dataset for Company-Level Stock Return Prediction

Karolina Sowinska, Pranava Madhyastha|arXiv (Cornell University)|Jun 17, 2020
Stock Market Forecasting Methods被引用数 4
ひとこと要約

本論文では、1日、2日、3日、7日後の株価変動方向をラベル付けした、862,231件の英語ツイートから成る公開済みの企業レベルのデータセットを紹介している。このデータセットにより、機械学習モデルがソーシャルメディアのセンチメントを用いて株価動向を予測可能となる。研究では、BERT、fastText、bag-of-wordsの特徴を組み合わせたマルチビュー学習が、特に3日後のリターン予測において予測精度を向上させることを示しており、マルチビュー手法を用いた際の最高F1スコアは0.61に達した。

ABSTRACT

Public opinion influences events, especially related to stock market movement, in which a subtle hint can influence the local outcome of the market. In this paper, we present a dataset that allows for company-level analysis of tweet based impact on one-, two-, three-, and seven-day stock returns. Our dataset consists of 862, 231 labelled instances from twitter in English, we also release a cleaned subset of 85, 176 labelled instances to the community. We also provide baselines using standard machine learning algorithms and a multi-view learning based approach that makes use of different types of features. Our dataset, scripts and models are publicly available at: https://github.com/ImperialNLP/stockreturnpred.

研究の動機と目的

  • Twitterからのソーシャルメディアセンチメントを活用することで、企業固有の株価リターン予測におけるギャップを埋める。
  • 微細な企業レベルの株価動向予測のためのラベル付きで公開可能なデータセットを提供する。
  • 多様なNLPおよび機械学習手法を用いて、ツイートからのテキスト特徴量の予測力を評価する。
  • より良い株価リターン方向予測のための単一ビューおよびマルチビュー学習アプローチをベンチマーク化する。

提案手法

  • データセットは、1日、2日、3日、7日後の企業レベルの株価リターンと関連付けられた862,231件のラベル付き英語ツイートから構成される。
  • 語彙的、サブワード的、文脈的な情報を捉えるために、bag-of-words、fastText、BERT埋め込みを用いてテキスト特徴量を抽出する。
  • センチメント極性はTextBlobおよびカスタムLSTMベースのセンチメント分類器を用いて測定される。
  • マルチビュー学習フレームワークでは、正準相関分析(CCA)を介して複数の特徴表現を統合し、その後自動機械学習パイプラインに供給する。
  • 研究では80:20のトレイン・テスト分割を採用し、異なるリターンホライズンにおける正解率を評価指標として用いる。
  • ベースラインモデルには標準的な機械学習アルゴリズムと、異なる特徴ビューからの射影を連結するマルチビュー学習アプローチが含まれる。

実験結果

リサーチクエスチョン

  • RQ1ツイートレベルのセンチメントおよびテキスト内容は、短期から中期の期間において、企業レベルの株価リターン方向を予測可能か?
  • RQ2BERT、fastText、BoWなどのマルチビューのテキスト特徴量を組み込むことで、単一ビューのモデルに比べて株価リターン予測がどの程度向上するか?
  • RQ3NLP特徴量を用いたツイートベースの株価リターン予測において、最適な予測ホライズン(1日、2日、3日、7日)は何か?
  • RQ4財務指標、ニュース件数、ソーシャルメディア件数のみを用いたモデルが、センチメントを組み込んだモデルに比べて、株価リターン方向をどの程度正確に予測できるか?
  • RQ5複数のNLP特徴表現をマルチビュー学習によって統合することで、個々の表現に比べてより高い予測性能が得られるか?

主な発見

  • fastTextとBERT特徴量を組み合わせたマルチビュー学習アプローチが、7日後の株価リターン方向予測で最高の正解率0.64を達成した。
  • 3日後のリターン予測において、BoWとfastText特徴量を用いたマルチビューモデルは正解率0.61を記録し、単一ビューのベースラインを上回った。
  • 最もパフォーマンスの優れた単一ビューモデル(BERT)は、1日後のリターン予測で正解率0.53を達成し、BoWやfastTextにわずかに劣らなかった。
  • 第3のベンチマークにおいてセンチメント情報を組み込んだことで、単に件数指標に依存するモデル(ベンチマーク2)に比べて予測正解率が向上した。
  • 結果から、マルチビュー学習が異なるNLP表現から得られる補完的情報を効果的に捉え、中期的な株価方向予測の予測力を強化していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。