Skip to main content
QUICK REVIEW

[论文解读] Linear predictor on linearly-generated data with missing values: non consistency and solutions

Marine Le Morvan, Nicolas Prost|arXiv (Cornell University)|Feb 3, 2020
Bayesian Modeling and Causal Inference参考文献 22被引用 13
一句话总结

本文研究了存在缺失数据时的线性预测问题,表明由于观测值与缺失指示变量之间的交互作用,最优预测器是非线性的。文章提出了两种估计器——一种基于每种缺失模式的贝叶斯预测器,另一种基于常数填充与掩码编码的估计器——并证明具有ReLU激活函数的多层感知机(MLPs)能够实现一致性,并在非忽略缺失机制(MNAR)下显著优于两种基线方法。

ABSTRACT

We consider building predictors when the data have missing values. We study the seemingly-simple case where the target to predict is a linear function of the fully-observed data and we show that, in the presence of missing values, the optimal predictor may not be linear. In the particular Gaussian case, it can be written as a linear function of multiway interactions between the observed data and the various missing-value indicators. Due to its intrinsic complexity, we study a simple approximation and prove generalization bounds with finite samples, highlighting regimes for which each method performs best. We then show that multilayer perceptrons with ReLU activation functions can be consistent, and can explore good trade-offs between the true model and approximations. Our study highlights the interesting family of models that are beneficial to fit with missing values depending on the amount of data available.

研究动机与目标

  • 理解在缺失数据存在时,线性预测面临的基本挑战,特别是在非忽略缺失机制下的情况。
  • 阐明标准线性模型在此情境下失效的原因,即其对缺失指示变量存在非线性依赖。
  • 开发并分析能够考虑缺失数据模式结构的实用估计器。
  • 评估多层感知机(MLPs)作为线性方法与基于插补方法的灵活且一致的替代方案的性能。
  • 建立泛化界,并识别各方法表现最佳的数据场景。

提出的方法

  • 在高斯假设下推导贝叶斯预测器,表明其依赖于观测值与缺失指示变量之间的多维交互作用,因而为非线性。
  • 提出第一种估计器:为每个唯一的缺失模式(即掩码模式)分别拟合一个线性模型,从而有效建模每种模式下的条件期望。
  • 提出第二种估计器:基于常数填充缺失值,并将缺失指示变量拼接到特征向量中,从而支持标准线性建模。
  • 为两种估计器建立有限样本泛化界,识别出在样本量、维度等参数下各方法表现更优的数据场景。
  • 分析具有ReLU激活函数的多层感知机(MLPs)的一致性,证明当网络宽度足够大时,MLPs可逼近真实贝叶斯预测器。
  • 证明MLPs可通过学习适当的阈值和权重,有效建模由缺失数据引发的复杂交互作用,尤其在MNAR机制下表现优异。

实验结果

研究问题

  • RQ1为何在缺失值存在时,即使真实关系为线性,线性生成数据的最优预测器仍不是线性的?
  • RQ2在有限样本下,基于模式的线性模型与基于插补的模型在泛化性能上如何比较?
  • RQ3多层感知机(MLPs)在缺失数据存在时能否实现一致性?在何种条件下可以实现?
  • RQ4MLP所需的网络宽度如何随缺失机制的复杂性和数据维度变化而变化?
  • RQ5在何种数据场景(如样本量、缺失机制)下,各方法——按模式回归、基于插补的回归或MLP——能实现最佳预测性能?

主要发现

  • 在高斯假设下,最优预测器为非线性,且涉及观测值与缺失指示变量之间的多维交互作用,这使得标准线性模型失效。
  • 按模式拟合的线性估计器在唯一缺失模式数量较少且数据充足时表现优异。
  • 基于插补的估计器在低维设置下且样本量适中时表现良好。
  • 泛化界表明,两种估计器的性能关键取决于样本量和缺失模式数量,且存在明确的场景依赖性优势。
  • 当隐藏单元数量足够大时,具有ReLU激活函数的多层感知机(MLPs)是一致的估计器,可逼近真实贝叶斯预测器。
  • 实验结果表明,MLPs在非忽略缺失(MNAR)下显著优于两种基线估计器,且对于如高斯混合模型等复杂数据生成机制,其所需宽度与 $2^d$ 成比例。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。