[论文解读] TabMT: Generating tabular data with masked transformers
TabMT 提出了一种用于生成高质量合成表格数据的新型掩码 Transformer 架构,通过改进的掩码技术处理异构数据类型、缺失值以及隐私权衡问题。该方法在多种数据集上实现了最先进性能,优于 GAN、VAE 和自回归模型,在质量、多样性和鲁棒性方面表现更优——尤其在通过温度控制实现隐私保护生成方面表现突出。
Autoregressive and Masked Transformers are incredibly effective as generative models and classifiers. While these models are most prevalent in NLP, they also exhibit strong performance in other domains, such as vision. This work contributes to the exploration of transformer-based models in synthetic data generation for diverse application domains. In this paper, we present TabMT, a novel Masked Transformer design for generating synthetic tabular data. TabMT effectively addresses the unique challenges posed by heterogeneous data fields and is natively able to handle missing data. Our design leverages improved masking techniques to allow for generation and demonstrates state-of-the-art performance from extremely small to extremely large tabular datasets. We evaluate TabMT for privacy-focused applications and find that it is able to generate high quality data with superior privacy tradeoffs.
研究动机与目标
- 开发一种稳健、可扩展且具备隐私意识的合成表格数据生成模型,以解决现有方法的局限性。
- 实现在从小型到大型数据集的各类数据集中高效生成高质量表格数据。
- 在训练和生成过程中原生处理缺失数据,无需插补或数据预处理。
- 通过温度缩放提供灵活的隐私权衡机制,实现数据效用与隐私的可控平衡。
- 在质量与结构保真度方面,证明其优于现有生成模型(包括 GAN、VAE 和自回归 Transformer)。
提出的方法
- TabMT 采用掩码 Transformer 架构,对表格字段中的掩码标记进行双向预测,实现对异构数据类型的联合建模。
- 采用可学习的掩码策略,每行应用唯一的掩码概率,从而在生成过程中实现灵活的条件控制。
- 模型通过掩码标记预测目标进行训练,被掩码字段从上下文重建,以提升表征学习能力。
- 通过平均字段级表征生成样本嵌入,用于下游评估,采用 Fréchet Inception Distance (FID) 和 Inception Score。
- 推理阶段支持温度缩放,以控制数据质量与隐私之间的权衡,减少模式崩溃并提升多样性。
- 对连续字段应用量化处理,实现离散标记化,从而在保留数据结构的同时促进训练与生成。

实验结果
研究问题
- RQ1掩码 Transformer 架构是否能在多样化的数据集上实现合成表格数据生成的最先进性能?
- RQ2TabMT 在训练和生成过程中如何处理缺失数据,这对数据质量和隐私有何影响?
- RQ3TabMT 通过温度缩放在多大程度上能平衡隐私与数据质量,与其它隐私保护方法相比表现如何?
- RQ4与专用模型(如 NFGAN)相比,TabMT 在特定领域基准(如 netflow 数据生成)上的表现如何?
- RQ5TabMT 在不同规模数据集上的可扩展性如何?模型大小对生成质量与多样性有何影响?
主要发现
- 在 netflow 数据集上,TabMT 的精确率为 88.10%,召回率为 91.12%,优于 NFGAN 的 77.64% 精确率与 63.32% 召回率。
- TabMT-L 在 netflow 数据集上实现了 99.43% 的多样性,而 NFGAN 仅为 46.97%,表明其具有更优的样本覆盖能力并显著减少模式崩溃。
- 与 NFGAN 相比,TabMT 将 netflow 不变量的中位违规率降低了 20 倍,TCP 标志的错误率最低达 6.54e-06,私有 IP 的错误率最低为 1.14e-05。
- 该模型展现出强大的可扩展性,所有模型尺寸(从小型到大型)的精确率与召回率均趋近于验证集水平。
- 在最大模型(TabMT-L)下,TabMT 在 netflow 数据集上实现了 100% 的多样性,表明其对数据分布实现了近乎完美的覆盖。
- 该模型的掩码机制实现了对缺失数据的原生处理,提升了在真实世界不完整记录场景下的鲁棒性与适用性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。