[论文解读] CoDi: Co-evolving Contrastive Diffusion Models for Mixed-type Tabular Synthesis
CoDi 提出了一种新颖的混合类型表格数据生成框架,采用两个相互协同演化的扩散模型——一个用于连续变量,一个用于离散变量——通过彼此条件化并结合对比学习与负采样进行联合优化。该方法在11个真实数据集上实现了生成质量与多样性的最先进性能,优于先前方法(包括 STaSy),同时降低了训练难度,并将采样速度提高了约90%。
With growing attention to tabular data these days, the attempt to apply a synthetic table to various tasks has been expanded toward various scenarios. Owing to the recent advances in generative modeling, fake data generated by tabular data synthesis models become sophisticated and realistic. However, there still exists a difficulty in modeling discrete variables (columns) of tabular data. In this work, we propose to process continuous and discrete variables separately (but being conditioned on each other) by two diffusion models. The two diffusion models are co-evolved during training by reading conditions from each other. In order to further bind the diffusion models, moreover, we introduce a contrastive learning method with a negative sampling method. In our experiments with 11 real-world tabular datasets and 8 baseline methods, we prove the efficacy of the proposed method, called CoDi.
研究动机与目标
- 为解决生成建模中混合类型表格数据(连续与离散变量)的挑战,现有方法常在变量间相关性上做出妥协。
- 通过在各自物理空间中处理连续与离散变量,而非映射到共享连续空间,提升合成表格数据的真实性与多样性。
- 通过协同演化条件训练与结构化负采样对比学习,增强连续与离散扩散模型之间的对齐。
- 相比依赖单一扩散过程联合建模混合类型的现有方法,减少训练不稳定性并提升收敛速度。
- 在表格数据生成学习三重困境(质量、多样性与泛化能力)之间实现更优平衡。
提出的方法
- 训练两个独立的扩散模型:一个在连续空间中处理连续变量,一个在离散空间中处理离散变量,从而更准确地学习每类变量的分布。
- 通过在每个时间步对彼此的前向与反向过程进行条件化,实现模型的协同演化,确保两类变量以保持跨变量依赖关系的方式共同更新。
- 分别对每个模型应用对比学习目标,使用锚点(原始样本)、正样本(使用正确条件生成的样本)和负样本(使用置换条件生成的样本)来对齐表征。
- 负采样通过在生成负连续样本时随机置换离散条件来实现,确保模型学会拒绝错误的相关性。
- 对比损失在训练过程中联合优化,强化两模型之间的对齐,提升泛化能力。
- 框架端到端训练,离散变量仅需进行独热编码处理,无需预/后处理,避免在连续空间中产生次优采样。
实验结果
研究问题
- RQ1与在单一空间中联合建模相比,为连续与离散表格变量分别训练扩散模型是否能提升生成质量?
- RQ2连续与离散扩散模型之间的协同演化条件训练是否能保持变量间的相关性,尤其是混合类型列之间的关系?
- RQ3结合结构化负采样的对比学习是否能增强离散与连续扩散模型之间的对齐,并提升样本多样性?
- RQ4与现有最先进表格数据生成模型相比,该方法在训练稳定性和收敛速度方面表现如何?
- RQ5该方法是否在生成学习三重困境(质量、多样性与泛化能力)之间实现了优于先前方法的更好平衡?
主要发现
- CoDi 在11个真实世界表格数据集上,相较于8种基线方法,在采样质量与多样性方面均表现更优,分类与回归任务中的F1分数与R²均有显著提升。
- 在Bank数据集上,CoDi的F1得分为0.566 ± 0.014,相比无对比学习基线(0.527 ± 0.032)提升了7.4%。
- 在Heart数据集上,CoDi相较基线将采样多样性提升了7.8%,覆盖度得分为0.949 ± 0.012。
- 对比学习组件显著稳定了训练过程,如Faults数据集所示,损失曲线平滑,而其他负采样方法则呈现波动。
- 由于更好的模型对齐,CoDi相比之前的SOTA方法STaSy,将采样时间减少了约90%。
- 消融研究显示,移除对比学习后,11个数据集中有7个性能下降,证实其在提升质量与多样性方面起着关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。