Skip to main content
QUICK REVIEW

[論文レビュー] StockEmotions: Discover Investor Emotions for Financial Sentiment Analysis and Multivariate Time Series

Jean Lee, Hoyoul Luis Youn|arXiv (Cornell University)|Jan 23, 2023
Stock Market Forecasting MethodsDecision Sciences被引用数 3
ひとこと要約

この論文では、StockTwitsから収集した金融ソーシャルメディアのコメント10,000件からなる新しいデータセット、StockEmotionsを紹介する。このデータセットは、12種類の微細な感情クラスと金融センチメントをラベル付けしており、高度なセンチメントおよび感情分析を可能にする。ハイブリッド人間-PLMラベル付けパイプラインを用いて、時系列アテンションLSTMが、価格データのみを用いる場合を上回る、S&P 500の多変量時系列予測性能を向上させることを実証した。

ABSTRACT

There has been growing interest in applying NLP techniques in the financial domain, however, resources are extremely limited. This paper introduces StockEmotions, a new dataset for detecting emotions in the stock market that consists of 10,000 English comments collected from StockTwits, a financial social media platform. Inspired by behavioral finance, it proposes 12 fine-grained emotion classes that span the roller coaster of investor emotion. Unlike existing financial sentiment datasets, StockEmotions presents granular features such as investor sentiment classes, fine-grained emotions, emojis, and time series data. To demonstrate the usability of the dataset, we perform a dataset analysis and conduct experimental downstream tasks. For financial sentiment/emotion classification tasks, DistilBERT outperforms other baselines, and for multivariate time series forecasting, a Temporal Attention LSTM model combining price index, text, and emotion features achieves the best performance than using a single feature.

研究の動機と目的

  • 金融分野におけるNLPのための、大規模かつ微細な金融センチメントおよび感情データセットの不足を解消すること。
  • 感情の粒度が不足し、絵文字や時系列整合性が欠けている既存のデータセットの限界を克服すること。
  • 事前学習言語モデルと専門家による検証を組み合わせた、信頼性の高い多段階ラベル付けパイプラインの開発。
  • 投資家の感情が、多変量株式市場時系列予測性能を向上させることの有効性を実証すること。
  • 金融センチメントおよび感情分類のためのベースラインモデル、およびテキスト・感情・価格データを統合した共同予測のためのベースラインモデルの確立。

提案手法

  • 金融ソーシャルメディアプラットフォームであるStockTwitsから、投資家感情および感情表現に焦点を当てた10,000件の英語コメントを収集した。
  • 行動ファイナンスおよび心理的研究に基づいた12クラスの感情分類体系を設計し、喜び、不安、怒り、楽観主義などの感情を含めた。
  • ハイブリッドラベル付けパイプラインを採用:まず事前学習言語モデル(PLM)を用いて感情を予測し、その後、金融専門家および人間ラベラーによる検証と是正を実施した。
  • 複数のデータモalityを統合:金融センチメント(ボリッシュ/ベアッシュ)、微細な感情、絵文字、および時系列株価指数データ(例:S&P 500)を統合した。
  • センチメントおよび感情分類のための7つのベースラインモデル(ロジスティック回帰、NBSVM、GRU、Bi-GRU、DistilBERT、BERT、RoBERTa)を訓練および評価した。
  • 価格指数、テキストセンチメント、感情特徴を時系列窓にわたってアテンションを用いて統合的に処理する、時系列アテンションLSTMモデルを構築し、S&P 500の予測を実施した。
Figure 1: Example from StockEmotions dataset showing investor psychology on the stock market. A combination of input data (stock price index, text and emoji, and emotion label) is used on a Temporal Attention LSTM for multivariate time series forecasting. (blue line = the actual S&P index, orange li
Figure 1: Example from StockEmotions dataset showing investor psychology on the stock market. A combination of input data (stock price index, text and emoji, and emotion label) is used on a Temporal Attention LSTM for multivariate time series forecasting. (blue line = the actual S&P index, orange li

実験結果

リサーチクエスチョン

  • RQ1微細な12クラスの感情分類体系は、二値センチメントラベルを上回る金融センチメントおよび感情分類を可能にするか?
  • RQ2ハイブリッド人間-PLMラベル付けパイプラインは、金融テキストの信頼性の高い感情ラベル生成にどの程度効果的か?
  • RQ3価格データおよびテキストデータと組み合わせた投資家の感情は、多変量時系列予測性能をどの程度向上させるか?
  • RQ4ディスティルBERT、BERT、LSTMのうち、どのディープラーニングアーキテクチャが金融センチメントおよび感情分類で最高のパフォーマンスを発揮するか?
  • RQ5テキスト・感情・価格特徴を統合してモデリングすることは、数値的またはテキスト的入力のみを用いるモデルを上回る性能を発揮するか?

主な発見

  • DistilBERTは、金融センチメント分類でF1スコア0.81、感情分類でF1スコア0.42を達成し、他のベースラインを上回った。
  • 価格指数、テキスト、感情特徴を統合的に学習する時系列アテンションLSTMモデルが、価格データのみを用いるモデルと比較して、S&P 500予測において最も優れたパフォーマンスを示した。
  • 感情分類のパフォーマンスは中程度であり、BERTを用いた場合、エクマンマッピングでマクロF1スコア0.48、プラッチクマッピングで0.40を記録し、金融テキストにおける感情検出の改善の余地があることを示した。
  • データセットは、金融スラングや皮肉の高頻度発生を明らかにした。例として、「BTD」(Buy The Dip)や「ATH」(All Time High)が頻繁に誤分類された。
  • 感情ラベルは、投資家のポジションバイアスのため、センチメントと一致しないことが多く、例として、価格下落時に長期保有者が怒りを示しても、センチメントは「ボリッシュ」とラベル付けされた。これは、裏にある楽観主義を反映している。
  • モデルのパフォーマンスはハイパーパrameterチューニングに敏感であり、特にロジスティック回帰やNBSVMのような小規模モデルでは、学習率およびドロップアウト値の変更が結果に顕著に影響した。
Figure 2: An overview of dataset creation pipeline.
Figure 2: An overview of dataset creation pipeline.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。