[论文解读] XTab: Cross-table Pretraining for Tabular Transformers
XTab 为表格变换器提出了一种跨表格预训练框架,通过联邦学习联合预训练特定数据的特征提取器与共享的变换器模块,实现了在不同列类型和数量的多样化数据集之间的知识迁移。该方法显著提升了泛化能力、学习速度和性能,在 OpenML-AutoML 基准的 84 个表格任务中超越了当前最先进模型。
The success of self-supervised learning in computer vision and natural language processing has motivated pretraining methods on tabular data. However, most existing tabular self-supervised learning models fail to leverage information across multiple data tables and cannot generalize to new tables. In this work, we introduce XTab, a framework for cross-table pretraining of tabular transformers on datasets from various domains. We address the challenge of inconsistent column types and quantities among tables by utilizing independent featurizers and using federated learning to pretrain the shared component. Tested on 84 tabular prediction tasks from the OpenML-AutoML Benchmark (AMLB), we show that (1) XTab consistently boosts the generalizability, learning speed, and performance of multiple tabular transformers, (2) by pretraining FT-Transformer via XTab, we achieve superior performance than other state-of-the-art tabular deep learning models on various tasks such as regression, binary, and multiclass classification.
研究动机与目标
- 解决表格深度学习模型在列类型和数量各异的新表格上泛化能力差的问题。
- 实现在不同领域多个表格之间的知识迁移,克服领域特定预训练的局限性。
- 开发一种可扩展的分布式预训练框架,支持表格变换器的迁移学习。
- 证明跨表格预训练能够提升未见表格上的学习速度、模型性能与泛化能力。
- 建立一个超越单一领域或单表微调的新型预训练基准。
提出的方法
- 将表格变换器分解为特定数据的特征提取器与共享的跨表格组件,以处理不同列类型和数量。
- 使用联邦学习在来自不同领域的大量表格集合上联合预训练共享组件。
- 在预训练过程中应用自监督的掩码列预测、对比学习等掩蔽任务,以学习通用的表格表示。
- 通过使用预训练的共享权重初始化新模型,加速在未见表格上的学习过程。
- 采用统一架构,将每列视为一个标记(token),支持对变长表格进行注意力建模。
- 在 OpenML-AutoML 基准的 84 个数据集上进行预训练,以确保广泛的领域覆盖与泛化能力。
实验结果
研究问题
- RQ1跨表格预训练能否提升表格变换器在列类型和结构各异的数据集上的泛化能力?
- RQ2在大规模异构表格集合上进行预训练,是否能加快下游任务的收敛速度并提升性能?
- RQ3联邦学习能否有效扩展至多个表格的预训练,同时保持模型的泛化能力?
- RQ4与随机初始化和领域特定预训练相比,XTab 在性能与样本效率方面表现如何?
- RQ5XTab 在多大程度上提升了如 FT-Transformer 等当前最先进表格模型的性能?
主要发现
- XTab 在 OpenML-AutoML 基准的 84 项任务中,持续提升了多个表格变换器的性能、学习速度与泛化能力。
- 使用 XTab 预训练权重微调的 FT-Transformer 在回归、二分类与多分类任务中均优于所有其他当前最先进表格深度学习模型。
- 在 mfeat-factors 数据集上,XTab 将对数损失从 0.1636(随机初始化)降低至 0.1089,相对提升 33.3%。
- 在 boston 回归任务中,XTab 将 RMSE 从 3.3039 降低至 2.8631,相对提升 13.3%。
- 在 wine-quality-white 多分类任务中,XTab 将对数损失从 0.803 降低至 0.7847,相对提升 2.3%。
- 在 84 项任务中的 18 项上,XTab 表现优于最佳基线模型,且在所有任务类型中均实现一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。