Skip to main content
QUICK REVIEW

[论文解读] Autoencoders and Probabilistic Inference with Missing Data: An Exact Solution for The Factor Analysis Case

Christopher K. I. Williams, Charlie Nash|arXiv (Cornell University)|Jan 11, 2018
Computational and Text Analysis Methods参考文献 2被引用 11
一句话总结

本文针对因子分析模型中存在缺失数据时潜在变量的后验推断,提出了精确的解析解,表明编码器网络必须针对每种独特的缺失模式重新训练。该方法实现了非迭代、单次前向传播的推断,相较于均值插补、FCA、SCA和去噪自编码器等近似方法表现更优,尤其在训练时已知缺失模式的情况下优势显著。

ABSTRACT

Latent variable models can be used to probabilistically "fill-in" missing data entries. The variational autoencoder architecture (Kingma and Welling, 2014; Rezende et al., 2014) includes a "recognition" or "encoder" network that infers the latent variables given the data variables. However, it is not clear how to handle missing data variables in this network. The factor analysis (FA) model is a basic autoencoder, using linear encoder and decoder networks. We show how to calculate exactly the latent posterior distribution for the factor analysis (FA) model in the presence of missing data, and note that this solution implies that a different encoder network is required for each pattern of missingness. We also discuss various approximations to the exact solution. Experiments compare the effectiveness of various approaches to filling in the missing data.

研究动机与目标

  • 解决在输入数据包含缺失值时,概率自编码器中潜在变量的精确后验推断挑战。
  • 在缺失数据条件下,基于线性高斯假设,推导因子分析模型后验分布的闭式解。
  • 证明最优编码器网络非平凡地依赖于特定的缺失模式,需为每种模式单独训练模型。
  • 在插补精度方面,将精确解与均值插补、FCA、SCA和去噪自编码器等实用近似方法进行比较。
  • 评估这些方法在不同缺失模式下的鲁棒性与局限性,特别是当训练与测试时的缺失模式不一致时。

提出的方法

  • 利用贝叶斯定理推导因子分析模型中 $p(\mathbf{z}|\mathbf{x}_v, \mathbf{m})$ 的精确后验分布,假设先验和似然均为高斯分布。
  • 通过公式 (1) 和 (2) 以闭式表达后验均值与协方差,其中 $\Sigma_{\mathbf{z}|\mathbf{x}_v} = (I_K + W_v^T \Psi_v^{-1} W_v)^{-1}$ 且 $\bm{\mu}_{\mathbf{z}|\mathbf{x}_v} = \Sigma_{\mathbf{z}|\mathbf{x}_v} W_v^T \Psi_v^{-1} (\mathbf{x}_v - \bm{\mu}_v)$。
  • 通过使用对角缺失矩阵 $M$ 重述后验分布,使缺失模式的依赖关系显式化,即 $\Sigma_{\mathbf{z}|\mathbf{x}_v} = (I_K + W^T M \Psi^{-1} M W)^{-1}$。
  • 提出三种近似方法:FCA(使用完整数据的因子分析)、SCA(结构化条件自编码器)以及在合成缺失数据模式上训练的去噪自编码器。
  • 训练去噪自编码器以从受损输入中预测潜在变量,且损坏模式与测试时预期的缺失模式一致。
  • 在弗雷人脸数据集上,使用精确解作为强基线,评估所有近似方法在随机和结构化缺失模式下的表现。

实验结果

研究问题

  • RQ1能否在因子分析模型中,通过闭式解实现缺失数据下潜在变量的精确后验推断?
  • RQ2最优编码器网络如何依赖于输入中特定的缺失数据模式?
  • RQ3与精确解相比,均值插补、FCA、SCA和去噪自编码器等近似推断方法在插补精度方面表现如何?
  • RQ4当训练与测试时的缺失模式不匹配时,对去噪自编码器性能有何影响?
  • RQ5线性模型中精确推断的洞见能否用于指导非线性自编码器在缺失数据下的推断机制设计?

主要发现

  • 基于闭式后验计算的精确推断方法,在弗雷人脸数据集的随机和结构化缺失模式下,均实现了最低的均方插补误差。
  • 当在随机缺失模式下训练但在结构化缺失模式(如缺失四分之一)下测试时,去噪自编码器表现较差,表明其对模式不匹配敏感。
  • 在四分之一缺失模式下,去噪自编码器略优于精确推断,可能由于真实数据分布与精确推断中使用的PPCA模型之间存在分布不匹配。
  • FCA和SCA相较于均值插补有逐步改进,且SCA优于FCA,表明对缺失模式的结构化建模可提升插补性能。
  • 随着可见数据增加,后验不确定性降低,而如嘴巴等区域的不确定性持续较高,反映出模型对局部结构的敏感性。
  • 去噪自编码器在训练与测试误差之间的差距表明,其在训练过程中利用了完整数据的后验信息,而这一信息在测试时并不可用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。