Skip to main content
QUICK REVIEW

[论文解读] MissDiff: Training Diffusion Models on Tabular Data with Missing Values

Yidong Ouyang, Liyan Xie|arXiv (Cornell University)|Jul 2, 2023
Bayesian Methods and Mixture Models被引用 4
一句话总结

MissDiff 提出了一种新颖的基于扩散的生成框架,直接在含有缺失值的表格数据上进行训练,无需事先填补缺失值,通过去噪分数匹配中的掩码回归损失,确保分数学习的一致性。在多种真实世界数据集上,面对不同的缺失机制,其在生成质量与下游任务实用性方面均大幅超越了当前最先进方法——包括‘先填补再生成’的流水线方法。

ABSTRACT

The diffusion model has shown remarkable performance in modeling data distributions and synthesizing data. However, the vanilla diffusion model requires complete or fully observed data for training. Incomplete data is a common issue in various real-world applications, including healthcare and finance, particularly when dealing with tabular datasets. This work presents a unified and principled diffusion-based framework for learning from data with missing values under various missing mechanisms. We first observe that the widely adopted "impute-then-generate" pipeline may lead to a biased learning objective. Then we propose to mask the regression loss of Denoising Score Matching in the training phase. We prove the proposed method is consistent in learning the score of data distributions, and the proposed training objective serves as an upper bound for the negative likelihood in certain cases. The proposed framework is evaluated on multiple tabular datasets using realistic and efficacious metrics and is demonstrated to outperform state-of-the-art diffusion model on tabular data with "impute-then-generate" pipeline by a large margin.

研究动机与目标

  • 解决在医疗、金融和社会系统中常见的不完整表格数据上训练生成模型的挑战。
  • 克服‘先填补再生成’流水线的局限性,该方法可能引入偏差并降低数据多样性。
  • 开发一种原则性、统一的框架,直接从缺失数据中学习,无需删除或填补。
  • 在温和的缺失机制假设下,为分数函数恢复和负对数似然上界提供理论依据。
  • 通过实证验证 MissDiff 在多个表格数据集上的数据保真度和下游任务实用性的优越性。

提出的方法

  • 在去噪分数匹配(DSM)中提出一种掩码回归损失,以在训练过程中处理缺失值,避免填补操作。
  • 引入一种改进的训练目标,将缺失数据模式直接整合到分数匹配过程中。
  • 该框架具有坚实的理论基础,证明了对真实分数函数学习的一致性,并在温和的缺失假设下提供了负对数似然的上界。
  • 将该方法应用于同时包含连续型和类别型特征的混合类型表格数据,能够处理两类变量中的缺失情况。
  • 采用去噪分数匹配目标,损失函数在缺失条目上被掩码,确保模型仅从观测数据中学习,避免偏差。
  • 采用统一架构,支持生成与填补双重功能,实现多功能实用性。

实验结果

研究问题

  • RQ1能否在不进行预先填补的情况下,有效训练一个在含有缺失值的表格数据上运行的扩散模型?
  • RQ2所提出的分数匹配中的掩码损失是否能实现对真实数据分数函数的一致估计?
  • RQ3与‘先填补再生成’基线方法相比,MissDiff 在数据保真度和下游任务实用性方面表现如何?
  • RQ4在 MAR 和 NMAR 缺失机制下,MissDiff 的泛化能力如何?
  • RQ5尽管 MissDiff 的设计目标是生成,它能否作为有效的填补模型使用?

主要发现

  • 在 MCAR 条件下的 Census 数据集上,MissDiff 在独立缺失机制下实现了 83.16% 的保真度,比表现第二好的方法(STaSy-mean)高出 26.1%。
  • 在行缺失机制下,MissDiff 实现了 80.59% 的分类准确率,显著优于 Diff-mean(76.92%)和 STaSy-mean(56.75%)。
  • 在大规模 MIMIC-4ED 数据集上,MissDiff 在行缺失机制下实现了 84.45% 的保真度,优于 Diff-delete(未报告性能)和 Diff-mean(75.22%)。
  • 在 MIMIC-4ED 数据集上的 RMSE 评估中,MissDiff 在行缺失机制下达到 1.826,优于 Diff-mean(2.166)和 STaSy-mean(1.894)。
  • 在 Census 数据集的 MAR 和 NMAR 机制下,MissDiff 分别实现了 77.45% 和 77.88% 的保真度,优于所有设置下的 Diff-delete 和 Diff-mean。
  • 在填补任务中,MissDiff 在 Census 数据集上实现了 0.087 的 RMSE,优于 CSDI-T(0.099)和 GAIN(0.123),展现出强大的填补能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。