[論文レビュー] Missing Values Handling for Machine Learning Portfolios
本論文は159個の横断的リターン予測因子における欠損構造を分析し、機械学習ポートフォリオに対してシンプルな横断平均推定がEMベースの推定としばしば同等の性能を示すことを示している。観測データが欠損値について限定的な情報しか提供しない理由として、時間構造化ブロックと横断相関の弱さを説明している。
We characterize the structure and origins of missingness for 159 cross-sectional return predictors and study missing value handling for portfolios constructed using machine learning. Simply imputing with cross-sectional means performs well compared to rigorous expectation-maximization methods. This stems from three facts about predictor data: (1) missingness occurs in large blocks organized by time, (2) cross-sectional correlations are small, and (3) missingness tends to occur in blocks organized by the underlying data source. As a result, observed data provide little information about missing data. Sophisticated imputations introduce estimation noise that can lead to underperformance if machine learning is not carefully applied.
研究の動機と目的
- 159個の横断的リターン予測因子の欠損の構造と起源を特徴付ける。
- 機械学習で構築したポートフォリオの欠損値処理戦略を評価する。
- ポートフォリオ文脈で高度な補完が予測性能を向上させるか、妨げるかを評価する。
提案手法
- 予測子データの欠損パターンと起源を特徴付ける。
- 単純な横断平均推定と期待値最大推定補完を比較する。
- 機械学習主導のポートフォリオ構築における補完の影響を評価する。
実験結果
リサーチクエスチョン
- RQ1予測データの欠損の構造と起源は何か?
- RQ2MLを用いたポートフォリオ構築において、横断平均推定はEM法と比較してどうか?
- RQ3高度な補完は、MLポートフォリオの性能を向上させるのか、それとも低下させるのか、どの条件下でそうなるのか?
主な発見
- 欠損は大規模な時間で組織されたブロックで発生する。
- 予測因子間の横断相関は小さい。
- 欠損は基礎データソースにより組織化されたブロックで発生する。
- この文脈では横断平均推定がEM法と比較して良好な性能を示す。
- 高度な補完は推定ノイズを導入し、ML手法が慎重に適用されない場合は性能を損なうことがある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。