Skip to main content
QUICK REVIEW

[论文解读] VAEs in the Presence of Missing Data

Mark Collier, Alfredo Nazábal|arXiv (Cornell University)|Jun 9, 2020
Energy Load and Power Forecasting参考文献 20被引用 10
一句话总结

本文提出了一种新颖的VAE框架,将缺失数据建模为一种污染过程,通过在编码器和解码器中引入缺失指示符,实现了对MCAR和MNAR数据的合理处理。与先前方法相比,该方法在MNIST和SVHN数据集上实现了更高的边缘对数似然值和更好的插补性能。

ABSTRACT

Real world datasets often contain entries with missing elements e.g. in a medical dataset, a patient is unlikely to have taken all possible diagnostic tests. Variational Autoencoders (VAEs) are popular generative models often used for unsupervised learning. Despite their widespread use it is unclear how best to apply VAEs to datasets with missing data. We develop a novel latent variable model of a corruption process which generates missing data, and derive a corresponding tractable evidence lower bound (ELBO). Our model is straightforward to implement, can handle both missing completely at random (MCAR) and missing not at random (MNAR) data, scales to high dimensional inputs and gives both the VAE encoder and decoder principled access to indicator variables for whether a data element is missing or not. On the MNIST and SVHN datasets we demonstrate improved marginal log-likelihood of observed data and better missing data imputation, compared to existing approaches.

研究动机与目标

  • 解决现有VAE方法在处理高维输入中的缺失数据时的局限性。
  • 开发一种将缺失数据生成为污染过程的生成模型,以实现可处理的推断。
  • 在不施加架构限制的前提下,使编码器和解码器都能访问缺失指示符(m)。
  • 在MCAR和MNAR假设下,改进对观测数据的概率建模以及缺失数据的插补。

提出的方法

  • 提出一种潜在变量模型,其中缺失数据通过污染过程生成,使用二值掩码向量m表示观测(1)和缺失(0)的元素。
  • 推导出log p(x_o|m)的可处理证据下界(ELBO),从而实现在缺失数据下的VAE端到端训练。
  • 修改VAE的编码器和解码器,使其以缺失指示符m为条件,使两个网络都能推理哪些输入是缺失的。
  • 采用条件VAE框架,联合优化生成模型p(x|m, z)和推理模型q(z|x̃, m)。
  • 使用重要性采样(256个样本)来估计测试集上的边缘对数似然值和插补质量。
  • 通过将污染过程建模为潜在机制而非假设随机或可忽略的缺失,支持MCAR和MNAR缺失。

实验结果

研究问题

  • RQ1如何在不施加架构限制的前提下,有效调整VAE以处理高维输入中的缺失数据?
  • RQ2向解码器提供缺失指示符(m)对模型性能和插补质量有何影响?
  • RQ3能否通过统一的污染过程生成模型,以合理方式处理MCAR和MNAR缺失?
  • RQ4与现有方法相比,该方法在边缘对数似然值和插补准确率方面表现如何?
  • RQ5以掩码m为条件是否能改善在污染输入中对模糊图像模式的消歧?

主要发现

  • ED Ind.方法(编码器和解码器均访问缺失指示符m)在MCAR和MNAR设置下,于MNIST和SVHN数据集上均显著提高了观测数据的边缘对数似然值,优于No Ind.基线。
  • EO Ind.变体(仅编码器使用m)在性能上优于No Ind.,但ED Ind.变体在插补质量上实现了统计显著的提升。
  • 可视化结果表明,ED Ind.通过利用缺失掩码的完整结构,能更准确地重建模糊数字(如7与9、2与1的混淆)。
  • 该方法在对数似然值和插补指标上均优于Nazabal等人(2018)的方法,配对t检验在60个随机种子下均确认了统计显著性。
  • 该模型在高维输入(如MNIST和SVHN)上表现出良好的可扩展性,引入掩码带来的计算开销可忽略不计。
  • 消融研究显示,解码器访问m对插补性能的提升优于仅编码器访问m,尽管对数似然值的边际增益较小但保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。