Skip to main content
QUICK REVIEW

[論文レビュー] DoubleEnsemble: A New Ensemble Method Based on Sample Reweighting and Feature Selection for Financial Data Analysis

Chuheng Zhang, Yuanqi Li|arXiv (Cornell University)|Oct 3, 2020
Stock Market Forecasting Methods参考文献 51被引用数 7
ひとこと要約

DoubleEnsemble は、学習軌道に基づくサンプル再重み付けとシャッフルに基づく特徴選択を組み合わせることで、モデルのロバスト性とパフォーマンスを向上させる、ファイナンシャルマーケット予測のための新しいアンサンブルフレームワークである。困難で情報量の多いサンプルを動的に重み付けし、重複のない特徴を選択することで、DNNおよび勾配ブースティングモデルを用いて暗号通貨および株式データにおいて、年間リターンが50%以上、シャープレシオが5.0前後、最大下落率が6.0%未塔の高い性能を達成した。

ABSTRACT

Modern machine learning models (such as deep neural networks and boosting decision tree models) have become increasingly popular in financial market prediction, due to their superior capacity to extract complex non-linear patterns. However, since financial datasets have very low signal-to-noise ratio and are non-stationary, complex models are often very prone to overfitting and suffer from instability issues. Moreover, as various machine learning and data mining tools become more widely used in quantitative trading, many trading firms have been producing an increasing number of features (aka factors). Therefore, how to automatically select effective features becomes an imminent problem. To address these issues, we propose DoubleEnsemble, an ensemble framework leveraging learning trajectory based sample reweighting and shuffling based feature selection. Specifically, we identify the key samples based on the training dynamics on each sample and elicit key features based on the ablation impact of each feature via shuffling. Our model is applicable to a wide range of base models, capable of extracting complex patterns, while mitigating the overfitting and instability issues for financial market prediction. We conduct extensive experiments, including price prediction for cryptocurrencies and stock trading, using both DNN and gradient boosting decision tree as base models. Our experiment results demonstrate that DoubleEnsemble achieves a superior performance compared with several baseline methods.

研究の動機と目的

  • 低信号対ノイズ比、非ステーションリティを示すファイナンシャルデータに適用される複雑なモデルにおける過学習と不安定性を解消すること。
  • 手動での選択が費用がかかりかつ非効率である高次元のファイナンシャルファクタースペースにおける、自動化された効果的な特徴選択を実現すること。
  • 動的サンプル重み付けと特徴選択を通じてモデルの一般化性能を向上させる統合型アンサンブルフレームワークの開発。
  • DNN や XGBoost などのベースモデルを含め、多様なファイナンシャル市場およびベースモデルにおいて、予測性能とロバスト性を向上させること。
  • イテレーティブな再トレーニングを回避するシャッフルに基づく手法により、特徴選択の計算コストを削減すること。

提案手法

  • サンプル再重み付けは、各サンプルの学習軌道に基づく:損失曲率が高く、収束が遅いサンプルは、重要な難易度の高いインスタンスを強調するために高い重みが割り当てられる。
  • 再重み付け方式は、過去のサブモデルの損失曲線と現在のアンサンブルの損失を用い、自己スケジューリング学習のスタイルでサンプル重みを計算する。
  • 特徴選択は、特徴のシャッフルを用いて実施される:各特徴がサンプル間でランダムにシャッフルされ、その結果生じる損失の変化が特徴の寄与度を定量化する。損失変化が小さい特徴は除外される。
  • サブモデルは、再重み付けされたサンプルと上位のパフォーマンスを示す特徴のサブセットを用いて逐次的に訓練され、多様性が確保され、過学習が軽減される。
  • このフレームワークは、深層ニューラルネットワークや勾配ブースティングツリーを含むさまざまなベースモデルと互換性があり、柔軟な展開が可能である。
  • 複数のサブモデルを、異なる重み付けされたサンプルと特徴セットで訓練したアンサンブルとして統合することで、一般化性能と安定性が向上する。

実験結果

リサーチクエスチョン

  • RQ1自己スケジューリング学習に基づく学習軌道によるサンプル再重み付け方式は、ノイズの多いファイナンシャルデータにおいて、重要で情報量の多いサンプルを効果的に特定・優先できるか?
  • RQ2シャッフルに基づく特徴選択法は、従来のイテレーティブな除去手法に比べ、ファイナンシャルモデルにおいて、効率性と安定性の面で優れているか?
  • RQ3サンプル再重み付けと特徴選択を統合したアンサンブルフレームワークは、ファイナンシャル予測における予測性能とロバスト性を顕著に向上させられるか?
  • RQ4DoubleEnsemble は、異なるファイナンシャルアセットおよびベースモデルにおいて、ベースライン手法と比較してリスク調整後のリターンと下落率に優れているか?
  • RQ5提案手法は、変動する市場環境および異なるベースモデルアーキテクチャにおいてもロバストであるか?

主な発見

  • DoubleEnsemble は、暗号通貨および株価予測タスクにおいて、年間リターンが50%以上、シャープレシオが5.0前後、最大下落率が6.0%未塔の高いパフォーマンスを達成した。
  • SimpleEnsemble や他の再重み付けベースライン(例:PCTWeighted、TimeWeighted)は、設定やベースモデルによって性能が不安定であったのに対し、本手法は一貫した優れた性能を示した。
  • サンプル再重み付け(SR)プロセスは、性能向上に顕著な寄与を示した。SR+Manual および SR+ALL は、それらに対応する SimpleEnsemble と比較して、より高いリターンとシャープレシオを達成した。
  • シャッフルに基づく特徴選択法は、イテレーティブな再トレーニングを回避することで、計算コストを削減しながらも、関連する特徴を効果的に同定した。
  • 本フレームワークは、異なるベースモデル(MLP および勾配ブースティング)および金融商品においてもロバストであったため、広範な適用可能性が示された。
  • サンプル再重み付けおよび特徴選択の計算コストは、サブモデルのトレーニングに比べて無視できるほど小さく、並列推論によりリアルタイムシステムへの低遅延デプロイが可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。