[论文解读] Identifiable Generative Models for Missing Not at Random Data Imputation
本文提出 GINA,一种用于缺失非随机(MNAR)数据的深度生成插补模型,并具备理论可识别性保证。通过在变分自编码器框架下显式建模缺失机制,GINA 在弱假设下确保模型参数可唯一恢复,从而实现无偏插补。该方法在合成数据和真实 MNAR 数据集上均优于现有方法,显著提升了插补准确率和下游任务性能。
Real-world datasets often have missing values associated with complex generative processes, where the cause of the missingness may not be fully observed. This is known as missing not at random (MNAR) data. However, many imputation methods do not take into account the missingness mechanism, resulting in biased imputation values when MNAR data is present. Although there are a few methods that have considered the MNAR scenario, their model's identifiability under MNAR is generally not guaranteed. That is, model parameters can not be uniquely determined even with infinite data samples, hence the imputation results given by such models can still be biased. This issue is especially overlooked by many modern deep generative models. In this work, we fill in this gap by systematically analyzing the identifiability of generative models under MNAR. Furthermore, we propose a practical deep generative model which can provide identifiability guarantees under mild assumptions, for a wide range of MNAR mechanisms. Our method demonstrates a clear advantage for tasks on both synthetic data and multiple real-world scenarios with MNAR data.
研究动机与目标
- 填补现有深度生成模型在 MNAR 数据插补中的关键空白,这些模型通常缺乏可识别性,因而导致插补结果有偏。
- 对多种 MNAR 机制下生成模型的可识别性进行理论分析,建立通过最大似然法实现参数唯一恢复的充分条件。
- 设计一种实用且可扩展的深度生成模型——GINA,在弱假设下确保可识别性,从而在真实世界的 MNAR 场景中实现可靠且无偏的插补。
- 在合成数据、真实世界数据集以及下游任务(如缺失数据下的主动特征选择)中,验证 GINA 的有效性。
提出的方法
- 提出一种基于变分自编码器的框架,联合建模数据分布 $ p_{\theta}(X) $ 和缺失机制 $ p_{\lambda}(R|X) $,实现两者的联合估计。
- 引入一个似然目标 $ \mathcal{L}_{K}(\theta,\lambda,\phi,X_{o},R) $,在考虑缺失模式通过掩码变量 $ R $ 的前提下,最大化可观测数据的似然。
- 通过显式建模缺失机制来确保可识别性,使得不同的参数配置产生不同的可观测数据分布,满足定义 2.1。
- 使用推理网络 $ q_{\phi}(Z|X_{o}) $ 近似真实后验 $ p_{\theta,\lambda}(Z|X_{o}) $,并在推理网络具有足够表达能力且模型设定正确时,证明其一致性。
- 通过利用潜在空间高效估算信息增益(基于 KL 散度近似),将模型应用于下游任务(如主动问题选择)。
- 采用基于潜在空间 KL 散度的快速近似信息奖励:$ R(i|X_{O}) \approx \mathbb{E}_{X_{i}} D_{KL}[q(Z|X_{i},X_{O})||q(Z|X_{O})] - \mathbb{E}_{X_{\phi},X_{i}} D_{KL}[q(Z|X_{\phi},X_{i},X_{O})||q(Z|X_{\phi},X_{O})] $。
实验结果
研究问题
- RQ1在何种条件下,深度生成模型在 MNAR 缺失机制下具有可识别性,从而能从无限数据中唯一恢复真实参数?
- RQ2当缺失机制复杂且不可观测时,如何在灵活的深度生成模型中保持可识别性?
- RQ3能否设计一种实用的深度生成模型,使其在多样化的现实世界数据场景中,同时实现可识别性与高性能的 MNAR 插补?
- RQ4在 MNAR 条件下,与现有方法相比,所提模型在插补准确率和下游任务性能方面表现如何?
主要发现
- GINA 在具有不同 MNAR 机制的合成数据集上实现了稳定且无偏的插补,散点图与真实密度估计(KDE)高度一致。
- 在 Eedi 和 UCI 等真实世界数据集(具有 MNAR 模式)上,GINA 在归一化均方根误差(NRMSE)和平均绝对误差(MAE)方面均优于基线方法(如 PVAE 和 Not-MIWAE)。
- 在主动特征选择任务中表现更优,能更高效地选择信息量更高的特征,其信息增益通过潜在空间 KL 散度近似进行衡量。
- 理论一致性已建立:在模型设定正确且推理网络表达能力充分的条件下,GINA 在无限数据极限下可恢复真实参数 $ \theta^* $ 和 $ \lambda^* $,至等价关系 $ \sim_A $。
- 实证结果表明,即使在复杂且不可忽略的缺失机制下,GINA 仍保持强大性能,而标准 VAE 或不可识别模型则因偏差而表现下降。
- 消融研究证实,显式建模缺失机制对可识别性和性能至关重要,移除该机制将导致插补质量显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。