Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning for Forecasting Mid Price Movement using Limit Order Book Data

Paraskevi Nousi, Avraam Tsantekidis|arXiv (Cornell University)|Sep 19, 2018
Stock Market Forecasting Methods参考文献 52被引用数 4
ひとこと要約

本稿では、高周波取引における中間価格の変動を予測するために、手作業で設計された限界注文書(LOB)特徴量と、自己符号化器およびBag-of-Features(BoF)モデルを用いて学習された表現を組み合わせる機械学習フレームワークを提案する。この手法は、複数の時間スケールにおいて顕著な予測性能を達成しており、手作業で設計された特徴量とハイブリッド表現が、特にMLP分類器と組み合わせた場合に最も優れた結果を示した。

ABSTRACT

Forecasting the movements of stock prices is one the most challenging problems in financial markets analysis. In this paper, we use Machine Learning (ML) algorithms for the prediction of future price movements using limit order book data. Two different sets of features are combined and evaluated: handcrafted features based on the raw order book data and features extracted by ML algorithms, resulting in feature vectors with highly variant dimensionalities. Three classifiers are evaluated using combinations of these sets of features on two different evaluation setups and three prediction scenarios. Even though the large scale and high frequency nature of the limit order book poses several challenges, the scope of the conducted experiments and the significance of the experimental results indicate that Machine Learning highly befits this task carving the path towards future research in this field.

研究の動機と目的

  • 限界注文書(LOB)データに、高周波取引における中間価格の変動を予測するのに十分な予測情報が含まれているかどうかを調査すること。
  • 手作業で設計された金融特徴量と機械学習で抽出された表現(例:自己符号化器、BoF)の両者を、将来の価格動向予測においてどの程度効果的かを評価すること。
  • SVM、MLP、SLFNといった複数の分類器が、異なる特徴表現および予測時間スケールにおいて、それぞれどのように性能を発揮するかを比較すること。
  • 現実の課題、例えばクラス不均衡、高データ速度、リアルタイム制約といった要因を考慮した金融予測における性能評価を行うこと。
  • 学習された表現が、従来の金融特徴量を補完または改善するかどうかを特定すること。

提案手法

  • 本研究では、複数の価格レベルと時間点における買付・売却指値の提示を捉えた高周波取引における限界注文書データを入力として使用する。
  • 2種類の特徴量が抽出される:(1) 財務的専門知識に基づく手作業で設計された特徴量(例:買付・売却スプレッド、不均衡、注文フロー)、および (2) 自己符号化器(AE)とBag-of-Features(BoF)モデルを用いた学習された表現。
  • 特徴表現には、結合(concat)、平均、最終値、およびハイブリッド形式(例:最終値+平均、最終値 ⊕ BoF)が含まれ、次元数は24から720の範囲をとる。
  • SVM、MLP、SLFNといった複数の分類器を、汎化性能とリアルタイム性能を評価する目的で、ホールドアウト法とウォークフォワード検証の2通りの実験設定を用いて訓練および評価する。
  • 統計的有意性の評価には、フリードマン検定とネーメニ氏の後続分析を用い、複数のシナリオにおいて分類器および特徴表現の差を比較する。
  • 予測シナリオは3つに分けられる:直近の1サンプル、直近5サンプルの平均変動、直近10サンプルの平均変動。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、限界注文書データのみを用いて中間価格の変動を効果的に予測できるか?
  • RQ2価格動向予測において、手作業で設計された金融特徴量と機械学習で抽出された表現の間で、性能にどのような差が生じるか?
  • RQ3どの特徴表現と分類器の組み合わせが、異なる時間スケールにおいて予測精度を最も高めるか?
  • RQ4入力表現の次元数がモデル性能に与える影響は何か?計算効率と予測力の間にはトレードオフがあるか?
  • RQ5高周波取引の金融データに一般的に見られるリアルタイム制約とクラス不均衡の下で、分類器の性能はどのように変化するか?

主な発見

  • MLP分類器は、すべてのシナリオにおいてSVMおよびSLFNを上回る性能を示し、SLFNに対して統計的に有意な向上を示したが、MLPとSVMの差はα=0.1の水準では有意ではなかった。
  • 時間的情報を含む手作業で設計された特徴量、特に平均および最後の値+平均の表現が、最も高い予測精度を達成しており、他の表現を顕著に上回った。
  • 次元数が同一でも、平均表現はノイズ低減効果(平均化によるノイズ抑制)のおかげで、最終値表現よりも優れた結果を出した。
  • BoFおよび最後の値 ⊕ BoFの表現は良好な性能を示したが、入力次元数が低下すると性能が劣化したため、効率性と識別力の間にはトレードオフがあることが示唆された。
  • 手作業で設計された特徴量と学習された特徴量を組み合わせることで、予測性能が向上した。これは、機械学習で抽出された特徴量が、従来の特徴量では捉えきれない潜在的かつ補助的な知識を抽出していることを示している。
  • フリードマン検定は帰無仮説を強く棄却した(p=5.5×10⁻³⁵)、これは少なくとも1つの特徴表現または分類器が顕著に異なる性能を示していることを確認した。ネーメニ氏の後続分析により、最も効果的な設定が同定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。