Skip to main content
QUICK REVIEW

[论文解读] STaSy: Score-based Tabular data Synthesis

Jayoung Kim, Chaejeong Lee|arXiv (Cornell University)|Oct 8, 2022
Generative Adversarial Networks and Image Synthesis被引用 8
一句话总结

STaSy 提出了一种基于分数的表格数据生成建模方法,通过自 paced 学习和微调策略,提升了采样质量和多样性,在 15 个基准数据集上,其质量(F1 与 R²:0.733)和多样性(覆盖率:0.658)均优于 7 个基线模型,同时保持了合理的训练时间。

ABSTRACT

Tabular data synthesis is a long-standing research topic in machine learning. Many different methods have been proposed over the past decades, ranging from statistical methods to deep generative methods. However, it has not always been successful due to the complicated nature of real-world tabular data. In this paper, we present a new model named Score-based Tabular data Synthesis (STaSy) and its training strategy based on the paradigm of score-based generative modeling. Despite the fact that score-based generative models have resolved many issues in generative models, there still exists room for improvement in tabular data synthesis. Our proposed training strategy includes a self-paced learning technique and a fine-tuning strategy, which further increases the sampling quality and diversity by stabilizing the denoising score matching training. Furthermore, we also conduct rigorous experimental studies in terms of the generative task trilemma: sampling quality, diversity, and time. In our experiments with 15 benchmark tabular datasets and 7 baselines, our method outperforms existing methods in terms of task-dependant evaluations and diversity. Code is available at https://github.com/JayoungKim408/STaSy.

研究动机与目标

  • 为解决使用深度生成模型生成高质量、多样化表格数据的挑战,这些模型常因复杂且多模态的列分布而失败。
  • 将基于分数的生成建模(SGM)适配至表格数据生成,利用去噪分数匹配提升样本保真度。
  • 通过引入自 paced 学习和微调策略,稳定 SGM 在表格数据上的训练过程,降低损失方差并提升模型收敛性。
  • 在多样化的现实世界表格数据集上,严格评估生成学习三重奏——质量、多样性和训练时间。
  • 通过平衡三者,建立表格数据生成的新 SOTA(最先进)水平。

提出的方法

  • 采用基于分数的生成建模(SGM),利用反向 SDE 过程通过从噪声扰动分布中去噪样本生成表格数据。
  • 使用时间依赖的分数网络 $ S_{\bm{\theta}}(\mathbf{x},t) $ 近似分数函数 $ \nabla_{\mathbf{x}} \log p_t(\mathbf{x}) $,实现通过去噪分数匹配的端到端训练。
  • 引入一种自 paced 学习策略,按损失幅度递增顺序对数据记录进行训练,从较简单(低损失)样本开始,以稳定训练过程。
  • 应用微调阶段,通过低学习率对模型参数进行适度调整,以进一步提升采样质量和多样性。
  • 使用 SDE 类型(VE、VP、sub-VP)和层类型(concat、squash、concatsquash),并对学习率、$ \alpha_0 $ 和 $ \beta_0 $ 进行超参数搜索。
  • 在训练和评估期间,使用 Hutchinson 估计器结合 Rademacher 或高斯噪声,高效计算对数概率。

实验结果

研究问题

  • RQ1尽管真实世界列数据具有复杂且多模态的分布,基于分数的生成建模是否能有效适配至表格数据生成?
  • RQ2自 paced 学习是否能提升表格 SGM 中去噪分数匹配的训练稳定性和收敛性?
  • RQ3微调是否能在基础 SGM 架构之上进一步提升采样质量和多样性?
  • RQ4STaSy 在平衡生成学习三重奏(质量、多样性与训练时间)方面,与现有基线相比表现如何?
  • RQ5STaSy 在多大程度上缓解了合成表格数据中的模式崩溃和分布偏移问题?

主要发现

  • STaSy 在 15 个基准数据集上实现了 0.733 的采样质量得分(F1 与 R²)和 0.658 的多样性得分(覆盖率),显著优于所有 7 个基线模型。
  • Naïve-STaSy 变体(无增强的基础 SGM)已优于除运行时间外的所有基线模型,实现 0.717 的质量得分和 0.637 的多样性得分。
  • 自 paced 学习稳定了训练过程,降低了损失方差——STaSy 中损失分布更集中于零附近,而 Naïve-STaSy 则呈现长尾分布。
  • 微调进一步提升了质量和多样性,证明其在初始训练后优化模型性能的有效性。
  • STaSy 有效缓解了模式崩溃,如 HTRU、Robot 和 News 数据集的 t-SNE 可视化所示,其生成的样本比 CTGAN、TableGAN 和 RNODE 更具多样性和真实性。
  • 该方法在质量、多样性和时间之间保持了有利的权衡,训练时间为 10.663 秒,优于 OCT-GAN(26.926 秒)等更慢的模型,同时实现了更优的质量和多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。