[論文レビュー] Comparative Study of Machine Learning Models for Stock Price Prediction
本研究では、10年間の歴史的データを用いて、次日の株価を予測するための機械学習モデル——特に線形カルマンフィルタとさまざまなLSTMアーキテクチャ——を比較した。低ボラティリティ株(例:MSFT)はカルマンフィルタで最もよく予測可能であり、高ボラティリティ株(例:TSLA)はCNN-LSTMのような複雑なLSTMを必要とし、R²値は最大0.96に達する。これは、最適なパフォーマンスを得るためにはモデル選択をボラティリティに応じて行うべきであることを示唆している。
In this work, we apply machine learning techniques to historical stock prices to forecast future prices. To achieve this, we use recursive approaches that are appropriate for handling time series data. In particular, we apply a linear Kalman filter and different varieties of long short-term memory (LSTM) architectures to historical stock prices over a 10-year range (1/1/2011 - 1/1/2021). We quantify the results of these models by computing the error of the predicted values versus the historical values of each stock. We find that of the algorithms we investigated, a simple linear Kalman filter can predict the next-day value of stocks with low-volatility (e.g., Microsoft) surprisingly well. However, in the case of high-volatility stocks (e.g., Tesla) the more complex LSTM algorithms significantly outperform the Kalman filter. Our results show that we can classify different types of stocks and then train an LSTM for each stock type. This method could be used to automate portfolio generation for a target return rate.
研究の動機と目的
- 歴史的時系列データを用いた機械学習モデルの次日株価予測における有効性を評価すること。
- ボラティリティの異なる株式に対して、線形カルマンフィルタと複数のLSTMアーキテクチャのパフォーマンスを比較すること。
- 訓練済みのLSTMモデルが、再訓練なしに異なる株式や市場インデックスに一般化可能かどうかを調査すること。
- ボラティリティによるモデルクラスタリングの可能性を検討し、ポートフォリオ自動生成やデイトレーディング戦略の自動化を可能にするかを検討すること。
提案手法
- yfinanceを用いて、2011年から2021年までの10年間の歴史的株価データ(テクノロジー株:MSFT、AAPL、TSLA、および市場インデックス:NASDAQ、S&P 500)を収集した。
- 直近3日間の事前分散推定を用いた再帰的線形カルマンフィルタを適用し、予測と測定の不確実性のバランスを取った。
- 単層、二層、双方向、およびCNN-LSTMを含む複数のLSTMバージョンを実装し、ミニマム・マックススケーリングと3次元時系列入力フォーマットを適用した。
- 7.5年分のデータを訓練に、残りの2.5年分をテストに使用し、逆スケーリングを用いて予測値と実際の価格を比較した。
- 予測精度を数量化するために、RMSE、MAE、R²の指標を用いてモデルのパフォーマンスを評価した。
- 上位パフォーマンスを示したモデル(双方向およびCNN-LSTM)を、再訓練なしにS&P 500およびラッセル・マクロキャップインデックスに拡張し、一般化性をテストした。
実験結果
リサーチクエスチョン
- RQ1低ボラティリティ株の株価予測において、線形カルマンフィルタはディープラーニングモデルを上回ることができるか?
- RQ2より深いまたはより複雑なLSTMアーキテクチャ(例:双方向、CNN-LSTM)は、高ボラティリティ株の予測精度を著しく向上させるか?
- RQ31つの訓練済みLSTMモデルが、類似したボラティリティ特性を持つ異なる株式や市場インデックスに一般化可能か?
- RQ4株式のボラティリティと、カルマンフィルタとLSTMの相対的パフォーマンスの相関関係は存在するか?
主な発見
- MSFTのような低ボラティリティ株では、カルマンフィルタがR² 0.99を達成し、双方向LSTMを含むすべてのLSTMバージョンを上回った。
- TSLAのような高ボラティリティ株では、CNN-LSTMモデルが最良のパフォーマンスを示し、RMSE 2.20、MAE 1.54、R² 0.96を達成した。
- 二層LSTMはMSFTにおいてカルマンフィルタよりパフォーマンスが悪く(RMSE 24.66)、安定株にはより深いアーキテクチャが必ずしも良いとは限らないことを示した。
- 双方向LSTMはMSFTでR² 0.99、TSLAでR² 0.95を達成し、ボラティリティの異なる株式で良好なパフォーマンスを示したが、高ボラティリティデータではCNN-LSTMを上回らなかった。
- 訓練済みのLSTMモデル(特に双方向およびCNN-LSTM)は、再訓練なしに市場インデックス(S&P 500およびラッセル・マクロキャップ)に一般化でき、両方でR² 0.99を達成した。
- これらの結果は、ボラティリティで株式をクラスタリングし、各クラスタに特化したモデルを訓練する戦略が、ポートフォリオ自動生成やアルゴリズム取引のスケーラブルな自動化を可能にするという主張を支持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。