[論文レビュー] Using Twitter Attribute Information to Predict Stock Prices
本研究では、歴史的株価、テクニカル指標、およびTwitterの属性(感情スコア、リツイート数、お気に入り数、フォロワー数、アカウントの公式認証ステータスなど)を統合したLSTMベースの深層学習モデルを構築し、株価予測を実施した。テクニカル分析とTwitterデータを組み合わせた場合、平均二乗誤差(MSE)が11%低減され、Twitter属性を追加した場合にもMSEが3%改善された。これは、株価動向予測におけるTwitter属性の段階的で価値ある寄与を示している。
Being able to predict stock prices might be the unspoken wish of stock investors. Although stock prices are complicated to predict, there are many theories about what affects their movements, including interest rates, news and social media. With the help of Machine Learning, complex patterns in data can be identified beyond the human intellect. In this thesis, a Machine Learning model for time series forecasting is created and tested to predict stock prices. The model is based on a neural network with several layers of LSTM and fully connected layers. It is trained with historical stock values, technical indicators and Twitter attribute information retrieved, extracted and calculated from posts on the social media platform Twitter. These attributes are sentiment score, favourites, followers, retweets and if an account is verified. To collect data from Twitter, Twitter's API is used. Sentiment analysis is conducted with VADER. The results show that by adding more Twitter attributes, the MSE between the predicted prices and the actual prices improved by 3%. With technical analysis taken into account, MSE decreases from 0.1617 to 0.1437, which is an improvement of around 11%. The restrictions of this study include that the selected stock has to be publicly listed on the stock market and popular on Twitter and among individual investors. Besides, the stock markets' opening hours differ from Twitter, which constantly available. It may therefore introduce noises in the model.
研究の動機と目的
- Twitter属性情報が、従来のテクニカル指標を上回る株価予測精度に寄与するかどうかを調査すること。
- 金融時系列データとソーシャルメディアの感情およびエンゲージメント指標を統合した深層学習モデルの開発と評価を行うこと。
- 感情、リツイート数、フォロワー数などのTwitter属性が、株価予測性能に与える段階的価値を評価すること。
- APIレート制限や市場活動とソーシャルメディア活動のタイミングの不一致といった、データ収集制約がモデルの頑健性に与える影響を検討すること。
- 公開可能なTwitterデータと歴史的株価データを用いたアルゴリズム取引への実用可能性を検討すること。
提案手法
- 長期短期記憶(LSTM)ユニットの複数層を用いた深層ニューラルネットワークアーキテクチャを構築し、時系列予測のための全結合層を追加した。
- モデルは、歴史的株価、テクニカル指標(例:SMA5、ボリンジャーバンド)、およびTwitter APIを介して抽出された特徴量として設計されたTwitter属性の組み合わせを学習データとして使用した。
- Twitterの感情分析にはVADER(Valence Aware Dictionary and sEntiment Reasoner)を用い、リツイート数、お気に入り数、フォロワー数、公式認証ステータスなどのエンゲージメント指標はツイートメタデータから抽出した。
- データ前処理には正規化と不均衡または欠損データの処理を含め、時系列予測におけるデータ漏洩を避けるために時系列の順序を保持することに重点を置いた。
- モデルの評価には、時系列の順序に従って分割されたテストセットにおける平均二乗誤差(MSE)を用いた。
- モデルの性能を比較するため、ベースライン(株価のみ)、テクニカル指標を追加したモデル、およびTwitter属性を追加したモデルを検証した。
実験結果
リサーチクエスチョン
- RQ1テクニカル指標と組み合わせた場合、感情、リツイート数、フォロワー数といったTwitter属性が、どの程度株価予測精度を向上させるか?
- RQ2ソーシャルメディアデータの導入が、市場が急変するような状況下でのモデルの汎化性能と頑健性に与える影響は?
- RQ3Twitter属性とテクニカル指標の両方が、株価予測誤差の低減に果たす相対的な貢献度は?
- RQ4APIレート制限や市場活動とソーシャルメディア活動のタイミングの不一致といったデータ収集制限が、モデル性能に与える影響は?
- RQ5金融データとソーシャルメディアデータのハイブリッドデータセットを学習データとして用いる場合、深層学習モデルは株価変動の非線形パターンを効果的に学習できるか?
主な発見
- テクニカル指標の導入により、平均二乗誤差(MSE)は0.1617から0.1437に低下し、予測精度が11%向上した。
- Twitter属性を単独で追加した場合、MSEの低下により予測精度が3%向上した。これは、ボラティリティの高い時期においてもTwitter属性が段階的な価値を持つことを示している。
- テクニカル指標とTwitter属性を併用した場合、モデルは最も高い性能を示した。これは、両者が補完的な情報源として機能している可能性を示している。
- モデルの成功にもかかわらず、Twitter属性の寄与度はテクニカル指標に比べてやや低く、根本的および技術的要因が依然として主な予測要因であると考えられる。
- データ収集の面で、APIレート制限、一時的なアカウント停止、計算制約による欠損データの影響により、データの完全性に影響が出た。
- 前処理手法、特にscikit-learnを用いた正規化は、Twitter感情スコアの影響を過小に評価する可能性があり、その真の予測力が隠れてしまうおそれがある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。