Skip to main content
QUICK REVIEW

[論文レビュー] Missing Values Handling for Machine Learning Portfolios

Andrew Y. Chen, Jack McCoy|arXiv (Cornell University)|Jul 21, 2022
Financial Markets and Investment Strategies被引用数 20
ひとこと要約

本論文は159個の横断的リターン予測因子における欠損構造を分析し、機械学習ポートフォリオに対してシンプルな横断平均推定がEMベースの推定としばしば同等の性能を示すことを示している。観測データが欠損値について限定的な情報しか提供しない理由として、時間構造化ブロックと横断相関の弱さを説明している。

ABSTRACT

We characterize the structure and origins of missingness for 159 cross-sectional return predictors and study missing value handling for portfolios constructed using machine learning. Simply imputing with cross-sectional means performs well compared to rigorous expectation-maximization methods. This stems from three facts about predictor data: (1) missingness occurs in large blocks organized by time, (2) cross-sectional correlations are small, and (3) missingness tends to occur in blocks organized by the underlying data source. As a result, observed data provide little information about missing data. Sophisticated imputations introduce estimation noise that can lead to underperformance if machine learning is not carefully applied.

研究の動機と目的

  • 159個の横断的リターン予測因子の欠損の構造と起源を特徴付ける。
  • 機械学習で構築したポートフォリオの欠損値処理戦略を評価する。
  • ポートフォリオ文脈で高度な補完が予測性能を向上させるか、妨げるかを評価する。

提案手法

  • 予測子データの欠損パターンと起源を特徴付ける。
  • 単純な横断平均推定と期待値最大推定補完を比較する。
  • 機械学習主導のポートフォリオ構築における補完の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1予測データの欠損の構造と起源は何か?
  • RQ2MLを用いたポートフォリオ構築において、横断平均推定はEM法と比較してどうか?
  • RQ3高度な補完は、MLポートフォリオの性能を向上させるのか、それとも低下させるのか、どの条件下でそうなるのか?

主な発見

  • 欠損は大規模な時間で組織されたブロックで発生する。
  • 予測因子間の横断相関は小さい。
  • 欠損は基礎データソースにより組織化されたブロックで発生する。
  • この文脈では横断平均推定がEM法と比較して良好な性能を示す。
  • 高度な補完は推定ノイズを導入し、ML手法が慎重に適用されない場合は性能を損なうことがある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。