[论文解读] AutoDiff: combining Auto-encoder and Diffusion model for tabular data synthesizing
AutoDiff 提出了一种新颖的表格数据生成器,通过将变分自编码器(VAEs)与基于分数的扩散模型相结合,生成高保真度的合成表格数据。通过学习异质特征(包括通过基于频率的虚拟变量编码的混合类型变量)的连续潜在表征,AutoDiff 有效捕捉了复杂的特征相关性,在 15 个数据集上的统计保真度和下游实用性方面优于最先进的 GAN 和基于扩散的方法。
Diffusion model has become a main paradigm for synthetic data generation in many subfields of modern machine learning, including computer vision, language model, or speech synthesis. In this paper, we leverage the power of diffusion model for generating synthetic tabular data. The heterogeneous features in tabular data have been main obstacles in tabular data synthesis, and we tackle this problem by employing the auto-encoder architecture. When compared with the state-of-the-art tabular synthesizers, the resulting synthetic tables from our model show nice statistical fidelities to the real data, and perform well in downstream tasks for machine learning utilities. We conducted the experiments over $15$ publicly available datasets. Notably, our model adeptly captures the correlations among features, which has been a long-standing challenge in tabular data synthesis. Our code is available at https://github.com/UCLA-Trustworthy-AI-Lab/AutoDiffusion.
研究动机与目标
- 解决在保留统计保真度的前提下,生成具有异质特征(数值型、离散型、混合类型)的合成表格数据的挑战。
- 克服现有基于 GAN 的模型(如 CTGAN)和基于扩散的模型(如 Stasy、TabDDPM)在建模复杂相关性和混合类型特征方面的局限性。
- 通过生成保持真实特征分布和特征间依赖关系的合成数据,提升下游机器学习的实用性。
- 通过分析到最近邻记录的距离(DCR)指标,增强隐私感知的生成能力,平衡记忆化风险与数据实用性。
提出的方法
- 采用变分自编码器(VAE)将异质表格特征映射到连续潜在空间,实现对复杂数据分布的端到端学习。
- 引入基于频率的虚拟变量来编码混合类型特征中的重复值,使 VAE 能够学习保留结构模式的表征。
- 在潜在空间中应用基于分数的扩散模型,生成反映特征联合分布的新颖且多样的潜在表征。
- 使用预训练解码器将生成的潜在向量重构为原始表格格式,包括混合类型特征及其对应的虚拟编码。
- 将重构后的混合类型特征与虚拟变量结合,生成最终的合成样本,以保留真实数据的结构和统计特性。
- 利用 TabDDPM 中的高斯分位数变换和评分网络架构,以提升性能,特别是在分类任务中。
实验结果
研究问题
- RQ1混合自编码器-扩散框架是否能比现有的 GAN 或仅基于扩散的模型更有效地建模异质表格特征,包括混合类型变量?
- RQ2与最先进的合成器相比,AutoDiff 在表格数据中保留复杂特征相关性方面的表现如何?
- RQ3与基线模型相比,AutoDiff 在下游机器学习任务(分类与回归)中的实用性提升程度如何?
- RQ4在记忆化方面,AutoDiff 的隐私权衡如何?以平均最近邻距离(MDCR)衡量,相较于其他模型有何表现?
- RQ5基于自编码器的编码是否能提升基于扩散的表格数据合成中的统计保真度与实用性?
主要发现
- AutoDiff 在所有模型中平均 MDCR 排名最高(6.33),表明其隐私性能较强,尽管并非最优,说明其在保真度与记忆化之间实现了良好平衡。
- 在分类任务中,AutoDiff(Tab-AutoDiff)达到 83.6% 的准确率和 0.659 的 F1 分数,优于 Stasy(82.0% 准确率,0.665 F1)和 CTGAN(69.9% 准确率,0.465 F1),并取得最高的 AUROC(0.852)。
- 在回归任务中,AutoDiff 的 R² 为 0.172,RMSE 为 4679.11,显著优于 Stasy(R² ≈ 0,RMSE = 1.06×10⁸)和 CTABGAN+(R² = 0.061,RMSE = 5518.107)。
- AutoDiff 在分类和回归任务的下游实用性方面均优于所有基于 GAN 的模型(CTGAN、TVAE、CTABGAN+、AutoGAN),展现出更优越的下游性能。
- 通过可视化对比验证了模型捕捉特征相关性能力:合成数据在分布上与真实数据高度一致,尤其在混合类型特征方面表现突出。
- Tab-AutoDiff 在回归任务中表现最佳,R² 为 0.172,RMSE 为 4679.11,显著优于 TabDDPM(R² = -9.39,RMSE = 17,322.613),表明 AutoDiff 在联合分布建模方面具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。