Skip to main content
QUICK REVIEW

[論文レビュー] Using Machine Learning and Alternative Data to Predict Movements in Market Risk

Thomas Dierckx, Jesse Davis|arXiv (Cornell University)|Sep 16, 2020
Stock Market Forecasting Methods被引用数 4
ひとこと要約

本研究では、機械学習モデルが、定量的市場データおよびGoogleニュースやWikipediaのページビューといった代替データソースを用いて、アップルの市場インプライド・ボラティリティの日々の変動を予測できるかを調査している。市場データのみが予測精度を最も高めた(SVMを用いた際のバランス化正解率64.2%)、が、本研究はWikipediaのトラフィックとインプライド・ボラティリティの間には非線形的関係が存在することを明らかにした。これは、より良い特徴工学や非線形アルゴリズムを用いることで、モデルの性能向上が可能である可能性を示唆している。

ABSTRACT

Using machine learning and alternative data for the prediction of financial markets has been a popular topic in recent years. Many financial variables such as stock price, historical volatility and trade volume have already been through extensive investigation. Remarkably, we found no existing research on the prediction of an asset's market implied volatility within this context. This forward-looking measure gauges the sentiment on the future volatility of an asset, and is deemed one of the most important parameters in the world of derivatives. The ability to predict this statistic may therefore provide a competitive edge to practitioners of market making and asset management alike. Consequently, in this paper we investigate Google News statistics and Wikipedia site traffic as alternative data sources to quantitative market data and consider Logistic Regression, Support Vector Machines and AdaBoost as machine learning models. We show that movements in market implied volatility can indeed be predicted through the help of machine learning techniques. Although the employed alternative data appears to not enhance predictive accuracy, we reveal preliminary evidence of non-linear relationships between features obtained from Wikipedia page traffic and movements in market implied volatility.

研究の動機と目的

  • 機械学習が、アップル株式の市場インプライド・ボラティリティの翌日の変動方向を予測できるかどうかを特定すること。
  • 具体的には、Googleニュースの件数とWikipediaのページビューという代替データが、予測性能に与える影響を評価すること。
  • 代替データの特徴とインプライド・ボラティリティの間には非線形的関係が存在するかどうかを評価すること。
  • 限られたオプションデータを用いて、機械学習モデルでボラティリティ変動を予測する可能性を検討すること。
  • 今後の研究のためのターゲット構築法やモデルキャリブレーションの改善可能性を同定すること。

提案手法

  • 379日間のトレーニングウィンドウと1日分のアウトオブサンプル予測を用いたスライディングウィンドウ・ウォークフォワード検証を実施し、合計106件のテストケースを生成した。
  • リターン、ボラティリティ、取引量などの定量的市場データ、Googleニュースの件数、Wikipediaのページビューから特徴量を抽出した。
  • ロジスティック回帰、RBFカーネルを用いたSVM、AdaBoostの3つの機械学習モデルを用い、すべてのモデルはscikit-learnのデフォルト設定を採用した。
  • ターゲット変数にクラスの不均衡(下落:59%、上昇:41%)が生じていたため、性能評価にはバランス化正解率を用いた。
  • 5つのデータソースのシナリオでアブレーションスタディを実施した:市場データのみ、市場+Googleニュース、市場+Wikipedia、市場+両方、および市場+両方+追加特徴量。
  • 予測確率の分析を通じて、モデルの信頼性(予測の正確性や変動の大きさとの相関)を検証した。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、アップル株式の市場インプライド・ボラティリティの翌日の変動方向を予測できるか?
  • RQ2GoogleニュースやWikipediaの代替データを組み込むことで、定量的市場データのみを用いた場合と比較して、予測精度が向上するか?
  • RQ3Wikipediaトラフィックの特徴とインプライド・ボラティリティの変動の間に非線形的関係が存在するか?このような関係は、線形モデルが見逃す可能性がある。
  • RQ4クラスの不均衡はモデル性能にどのような影響を及ぼすか?バランス化正解率は、より信頼性の高い評価指標を提供するか?
  • RQ5モデルの信頼性スコア(予測確率)は、より正確な予測を特定するのや、変動の大きさと相関するのを助けることができるか?

主な発見

  • 最高の予測性能は、定量的市場データのみを用いた場合に達成され、RBFカーネルを用いたSVMを用いた際のバランス化正解率は64.2%であった。
  • Googleニュースの件数を組み込むと、すべてのモデルで性能が低下し、このデータソースには予測価値が限定的であると考えられる。
  • Wikipediaのページビューは、インプライド・ボラティリティの変動と非線形的関係にあることが、AdaBoostが他のモデルを上回ったことから裏付けられた。
  • ロジスティック回帰はWikipediaの特徴量を組み込むと著しく性能を落とし、関係性が非線形的であり、アンサンブル手法によりより良く捉えられる可能性があることを示唆している。
  • 代替データを組み込んだ場合の最高成績は、市場データとWikipedia特徴量を組み合わせたAdaBoostを用いた63.0%のバランス化正解率であったが、依然として市場データのみのベースラインを下回っていた。
  • すべてのデータソースを組み合わせた場合に顕著な改善が得られなかったことから、特徴量のノイズやモデルの限界が、小規模データセットにおける汎化性能を妨げている可能性があると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。