Skip to main content
QUICK REVIEW

[论文解读] Missing Values Handling for Machine Learning Portfolios

Andrew Y. Chen, Jack McCoy|arXiv (Cornell University)|Jul 21, 2022
Financial Markets and Investment Strategies被引用 20
一句话总结

本论文分析了 159 个横截面回报预测变量中的缺失结构,并表明简单的横截面均值插补在机器学习投资组合中的表现通常与基于 EM 的插补相当。

ABSTRACT

We characterize the structure and origins of missingness for 159 cross-sectional return predictors and study missing value handling for portfolios constructed using machine learning. Simply imputing with cross-sectional means performs well compared to rigorous expectation-maximization methods. This stems from three facts about predictor data: (1) missingness occurs in large blocks organized by time, (2) cross-sectional correlations are small, and (3) missingness tends to occur in blocks organized by the underlying data source. As a result, observed data provide little information about missing data. Sophisticated imputations introduce estimation noise that can lead to underperformance if machine learning is not carefully applied.

研究动机与目标

  • 刻画 159 个横截面回报预测变量的缺失结构及其起源。
  • 评估用于通过机器学习构建的投资组合的缺失值处理策略。
  • 评估在投资组合情境中,何时复杂的插补会增加或降低预测性能。

提出的方法

  • 刻画预测变量数据中的缺失模式及其起源。
  • 将简单的横截面均值插补与期望最大化插补进行比较。
  • 评估插补对以机器学习驱动的投资组合构建的影响。

实验结果

研究问题

  • RQ1预测变量数据中的缺失结构与起源是什么?
  • RQ2在使用 ML 构建投资组合时,横截面均值插补与 EM 方法的比较如何?
  • RQ3在 ML 投资组合中,何种条件下复杂的插补会提升或降低性能?

主要发现

  • 缺失发生在大块的时间组织中。
  • 预测变量之间的横截面相关性很小。
  • 缺失往往按基础数据源组织成块出现。
  • 在此情境下,横截面均值插补的表现与 EM 方法相当。
  • 若未对 ML 方法进行谨慎应用,复杂的插补可能引入估计噪声,损害性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。