[論文レビュー] Predicting The Stock Trend Using News Sentiment Analysis and Technical Indicators in Spark
本論文は、Sparkを用いて技術的インジケータとニュースセンチメントスコアを統合するハイブリッド株価トレンド予測モデルを提案する。2値分類(上昇トレンド/下落トレンド)を対象とし、ロジスティック回帰、ランダムフォレスト、勾配ブースティングマシンを適用した。S&P 500の銘柄(AAPL、AMZN、NFLX)を対象に、ランダムフォレストが最高性能を示し、テスト精度は63.58%を達成した。
Predicting the stock market trend has always been challenging since its movement is affected by many factors. Here, we approach the future trend prediction problem as a machine learning classification problem by creating tomorrow_trend feature as our label to be predicted. Different features are given to help the machine learning model predict the label of a given day; whether it is an uptrend or downtrend, those features are technical indicators generated from the stock's price history. In addition, as financial news plays a vital role in changing the investor's behavior, the overall sentiment score on a given day is created from all news released on that day and added to the model as another feature. Three different machine learning models are tested in Spark (big-data computing platform), Logistic Regression, Random Forest, and Gradient Boosting Machine. Random Forest was the best performing model with a 63.58% test accuracy.
研究の動機と目的
- ビッグデータプラットフォームを活用して技術的インジケータと金融ニュースのセンチメントを統合することで、株価トレンド予測の精度を向上させること。
- スケーラブルな機械学習パイプラインにおいて、ファンダメンタル(ニュースセンチメント)とテクニカル(価格ベースのインジケータ)分析を組み合わせた有効性を評価すること。
- Apache Sparkを用いた株価トレンド分類において、複数の機械学習モデル(ロジスティック回帰、ランダムフォレスト、勾配ブースティングマシン)の性能を評価すること。
- Apache SparkのMLlibフレームワークにおける並列実行により、学習時間を短縮し、ハイパーパramータチューニングの効率を向上させること。
提案手法
- 毎日の株価データ(始値、高値、安値、終値、出来高、調整終値)を収集し、SMA、RSI、MACD、ボリンジャーバンドを含む10種類の技術的インジケータを計算した。
- 2016年から2020年までの金融ニュース記事9.2 GBを収集し、BERTベースのNLPモデルを用いて、平均プooled文書埋め込みにより毎日のセンチメントスコアを抽出した。
- 同じ日に公開された全ニュースをグループ化し、取引日ごとの統合センチメントスコアを算出した。
- 各銘柄について9つの変数からなる最終的な特徴量セットを構築した:6つのテクニカルインジケータ(SMA、RSI、MACD、ボリンジャーバンド、OBV、ストキャスティックオシレーター)、出来高、統合済みの日次センチメントスコア。
- MinMaxScalerによる特徴量正規化、RFormulaによるカテゴリカルラベルのワンホットエンコーディング、およびグリッドサーチを用いた10分割交差検証によるハイパーパramータチューニングを実施したSpark MLパイプラインを適用した。
- トレーニングデータの80%とテストデータの20%に分割し、ロジスティック回帰、ランダムフォレスト、勾配ブースティングマシンの3つの分類器を訓練・評価した。評価指標には精度、適合率、再現率、F1スコアを用いた。
実験結果
リサーチクエスチョン
- RQ1価格データのみを用いる場合と比較して、技術的インジケータとニュースセンチメントスコアを統合することで、株価トレンド予測の精度が向上するか?
- RQ2ハイブリッドな金融的・センチメント特徴量を用いてトレーニングされた場合、ロジスティック回帰、ランダムフォレスト、勾配ブースティングマシンといった異なる機械学習モデルは、株価トレンド方向(上昇/下落)の分類において、どのように性能を発揮するか?
- RQ3Apache Sparkを用いることで、大規模な金融データセットに対する株価予測モデルのスケーラビリティと学習効率はどの程度向上するか?
- RQ4特徴量間の相関がモデル性能に与える影響は何か?また、重複する特徴量を除外するような特徴量選択(例:非冗長な特徴量の保持)は、予測精度にどのように影響するか?
主な発見
- ランダムフォレストが、AAPL、AMZN、NFLXの3銘柄すべてで最高のテスト精度63.58%を達成し、他の2モデルを上回った。
- モデルはトレーニング精度65.5%を示し、わずかな過学習を示しながらも、独立したテストセットにおいても安定した性能を維持した。
- 特徴量相関分析の結果、始値、高値、安値、終値、調整終値、SMAといった価格ベースの特徴量間に高い相関関係が認められ、冗長性を低減するためSMA、高値、終値のみを保持した。
- BERTベースのNLPを用いたセンチメント分析により、文脈を考慮したセンチメントスコアが得られ、これが予測特徴量として効果的に統合された。
- Sparkベースのパイプラインにより、並列処理が効率的に行われ、学習時間が顕著に短縮され、大規模なグリッド構成における広範なハイパーパramータチューニングを支援した。
- モデルの精度は中程度であったが、結果から、ボラティリティの高い市場においてもニュースのセンチメントと技術的インジケータを統合することで、意味のある予測信号が得られることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。