Skip to main content
QUICK REVIEW

[论文解读] missIWAE: Deep Generative Modelling and Imputation of Incomplete Data.

Pierre‐Alexandre Mattei, Jes Frellsen|arXiv (Cornell University)|Dec 6, 2018
Domain Adaptation and Few-Shot Learning参考文献 55被引用 16
一句话总结

本文提出MIWAE,一种用于不完整数据的深度生成建模方法,通过将重要性加权自编码器(IWAE)扩展至处理随机缺失数据,且无需额外计算开销。通过最大化观测数据对数似然的紧致下界,MIWAE实现了准确的单次和多次插补,其性能与在完整数据上训练的模型相当,已在MNIST及其他基准数据集上得到验证。

ABSTRACT

We consider the problem of handling missing data with deep latent variable models (DLVMs). First, we present a simple technique to train DLVMs when the training set contains missing-at-random data. Our approach, called MIWAE, is based on the importance-weighted autoencoder (IWAE), and maximises a potentially tight lower bound of the log-likelihood of the observed data. Compared to the original IWAE, our algorithm does not induce any additional computational overhead due to the missing data. We also develop Monte Carlo techniques for single and multiple imputation using a DLVM trained on an incomplete data set. We illustrate our approach by training a convolutional DLVM on a static binarisation of MNIST that contains 50% of missing pixels. Leveraging multiple imputation, a convolutional network trained on these incomplete digits has a test performance similar to one trained on complete data. On various continuous and binary data sets, we also show that MIWAE provides accurate single imputations, and is highly competitive with state-of-the-art methods.

研究动机与目标

  • 解决在缺失值为随机缺失(MAR)的数据上训练深度潜在变量模型(DLVMs)的挑战。
  • 开发一种方法,在保持重要性加权自编码器(IWAE)优势的同时,适应不完整数据且不增加计算成本。
  • 利用在不完整数据上训练的DLVM实现有效的单次和多次插补。
  • 证明使用MIWAE训练的模型在测试性能上可与在完整数据上训练的模型相媲美。

提出的方法

  • 提出MIWAE,一种IWAE的变体,通过在随机缺失假设下最大化观测数据对数似然的下界。
  • 通过修改重要性权重以考虑缺失条目,将重要性加权估计框架适配于处理缺失数据。
  • 引入蒙特卡洛技术,利用训练好的MIWAE模型实现单次和多次插补。
  • 尽管存在缺失数据,仍通过避免训练期间的额外开销,保持计算效率。
  • 采用卷积DLVM架构以建模复杂数据分布,例如50%像素缺失的二值化MNIST数据。
  • 采用重参数化与随机梯度估计,实现不完整数据上的端到端训练。

实验结果

研究问题

  • RQ1能否通过修改的重要性加权自编码器框架,有效训练具有随机缺失条目的深度生成模型?
  • RQ2与标准IWAE相比,所提出的MIWAE方法在处理缺失数据时是否保持计算效率?
  • RQ3MIWAE能否生成准确的单次和多次插补,使下游模型性能与在完整数据上训练的模型相当?
  • RQ4在多样化的连续与二值数据集上,MIWAE与最先进插补方法相比表现如何?

主要发现

  • 在50%像素缺失的二值化MNIST数据集上,使用MIWAE插补数据训练的卷积网络,其测试性能与在完整数据上训练的模型相当。
  • MIWAE在多种连续与二值数据集上提供了准确的单次插补,性能优于或匹配最先进方法。
  • 尽管存在缺失数据,该方法在训练期间未引入额外计算开销,保持了IWAE的高效性。
  • 使用MIWAE进行多次插补提升了下游模型的泛化能力,证明了不确定性感知插补的实用性。
  • MIWAE框架在观测数据对数似然上实现了紧致下界,表明模型对不完整数据具有良好的拟合能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。